将多模态智能体的交互轨迹解耦为原子级状态-动作经验,通过深度-广度搜索实现精准决策指导
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
构建离线语料库与浏览器原语,低成本合成97K+深度研究轨迹
系统研究长视界工具使用代理的强化学习设计空间,提出STAR框架和规模感知的训练方法
通过agentic mid-training和验证推理提升长链推理,BrowseComp达88.2
多模态AI智能体的前瞻性规划
👍 3两阶段RL框架训练多模态Agent前瞻性规划能力,在7个基准上显著提升长视界任务性能
首个系统评估LLM在复杂约束下工具使用能力的基准测试
首个大规模企业级智能体基准,揭示当前最强模型仅37%成功率,规划而非工具调用是核心瓶颈
提出XSKILL双流框架,使多模态智能体从视觉轨迹持续学习技能与经验。
证据优先合成智能体任务,扩展多样性以提升工具使用泛化能力
ICRL:纯RL框架实现LLM工具调用,无需SFT,渐进消除少样本提示
评估多模态智能体长时序工具使用能力的现实视觉基准
用索引式外部记忆+RL训练,让LLM智能体在有限上下文窗口下高效完成长程任务
提出全模态智能体基准OmniGAIA和原生全模态基础智能体OmniAtlas
用过采样-过滤-排序和累积工具奖励解决多模态RL训练中的交互坍缩问题
通过规划图+约束解码双管齐下,消除LM智能体的不可恢复失败
首个针对工具型AI代理Clawdbot的六维度轨迹级安全评估
构建1780个科学工具环境与基准,揭示LLM在长序列科学推理中的瓶颈
提出INTENT框架,通过意图感知世界模型在推理时实现预算受限的工具使用规划
用代码+数据库自动合成1000个可执行环境,用于大模型智能体的强化学习训练
提出可控扩展环境状态的基准测试,揭示语言代理在长上下文下的性能退化与失败模式