五机制多智能体自主科研管线,在ARC-Bench上超AI Scientist v2 54.7%
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用三智能体自动构建可执行工具环境,并合成自然多轮轨迹训练工具调用LLM。
把文本技能升级为可执行状态-动作干预函数,全面提升 LLM 智能体表现
为百万级 Agent Skill 生态构建一个采集-推荐-归因-演化的闭环治理框架,抑制噪声与误归因对技能库的污染。
用学习的记忆控制器为冻结 GUI 基座插拔式注入多模态工作与情景记忆
首篇将 LLM 多智能体系统全生命周期串成 LIFE 四阶段的统一综述
在零目标任务经验下,通过提议者引导的合成练习与验证门控的记忆准入,构建部署前的程序性记忆。
用书签式问答对在长剧情中按需检索与增量同步,让角色扮演智能体既保留细节又省算力
从动作引导中学习智能体策略
👍 12用纯动作数据(无推理链)作参考引导,突破智能体RL的可达性壁垒,无需SFT冷启动即可比肩SFT+RL流程。
带主动信息索取的上下文训练
👍 7为上下文优化器装上浏览器与维基百科工具,用束搜索训练消解检索噪声。
把生成式世界模型塞进 MCP 智能体循环,用预测式规划替代反应式执行。
训练免费框架,让多智能体在测试时三尺度协同进化。
OPPO 边缘原生 Android 智能体,多模态感知+行为克隆
面向智能体强化学习的动态技能生命周期管理
👍 13SLIM:把外部技能集当成可训练变量,动态增删扩展
借鉴编译器架构,提出四阶段流水线 SKCC,用强类型 IR 把 SKILL.md 升级为跨框架技能。
提出存储-反思-经验三阶段演化框架,统一LLM智能体记忆机制的研究视角。
用单一任务结果信号同时驱动技能选择、利用与蒸馏三阶段协同演化
用强化学习训练技能策展器,让 LLM 智能体在长任务流中持续积累并精炼可复用技能。
提出 SSL 三层结构化表示,显式拆分技能文本的调用、流程与动作证据
构建方法级演进图谱,为 AI 智能体提供可推理的研究基础设施