提出PLANET角色从业务场景合成可执行可验证环境,训练出的策略在域内外基准均显著提升。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
把视频理解重构为多轮工具增强任务,20个前沿模型全部低于60%准确率
首个跨用户个人工作空间多智能体协作与攻击可审计的沙盒基准
构建可验证的离线维基百科环境,让搜索智能体自蒸馏迭代进化。
现代智能体系统中的自我改进:综述
👍 29把自我改进智能体形式化为参数更新与脚手架更新两条路径,统一梳理历史、分类、应用与评估。
通过完整轨迹评估代码智能体的生产级基准测试框架
CanvasAgent协调11种视觉工具实现复杂图像创建与编辑。
代理弃权:代理知道何时停止而不是行动吗?
👍 147研究LLM代理何时应停止行动而非继续交互,提出CONVOLVE方法改善及时弃权能力
通过扩展智能体视野和领域路由蒸馏,35B模型达到万亿参数性能
通过梯度计算实现token级别的跨智能体错误归因与优化
揭示多步工具RL崩溃机制,提出过程反思监督有效解决训练不稳定性问题
首个针对未解决生物医学问题的智能体基准,测试文献综合与引用忠实度
揭示并缓解LLM智能体在工具选择中的过度特权行为
首个大规模交互式基准,评估LLM智能体在1665个工具环境下的长期规划与适应性重规划能力
通过层次化空间工具和双记忆系统,将空间推理重构为时空证据积累过程,显著提升VLM的空间理解能力。
用 2K 仿真轨迹蒸馏到 4B 模型,实现前沿级操作性能
利用奖励方差检测能力边界,动态合成高质量多轮工具使用训练数据
通过推理时进化搜索修复紧凑模型工具工作流,提升执行可行性
通过构建场景记忆和技能库,学习场景感知的工具使用技能,解决 MLLM 智能体在 3D 空间推理中的工具误用问题
提出多阶段门控机制,在保持准确率的同时将网络代理工具调用减少17%-58%