通过显式账本和策略门解决工具调用智能体的状态跟踪和策略遵从问题
Md Nayem Uddin, Amir Saeidi, Eduardo Blanco, Chitta Baral
2026-06-19
工具调用
推理时方法
智能体
状态管理
策略遵从
用 rollout 级冲突过滤 + query 级重加权,解决多奖励聚合中正负优势互相抵消的难题。
Haotian Liu, Yihao Liu, Jingwei Ni, Siyuan Huang, Xinpeng Liu, Pengyu Cheng,...
2026-06-16
GRPO改进
LLM后训练
RLHF
多目标强化学习
工具调用
让MLLM学会何时调用、验证、信任世界模型的视频推演来预测未来。
Yucheng Zhou, Wei Tao, Yiwen Guo, Jianbing Shen
2026-06-03
世界模型
多模态大模型
工具调用
强化学习
推理
首个面向真实个性化MCP工具的智能体评测基准,揭示SOTA模型仍难及格
Wenhao Wang, Peizhi Niu, Gongyi Zou, Xiyuan Yang, Jingxing Wang, Haoting...
2026-06-02
MCP
个性化助手
基准测试
工具调用
智能体评测
12B参数MoE模型,仅激活2.5B参数,实现代码生成和工具调用的IDE部署级效率
Marko Kojic, Ivan Bondyrev, Aral de Moor, Joseph Shtok, Petr Borovlev,...
2026-06-01
Mixture-of-Experts
RLVR
代码生成
工具调用
投机解码
首个评估LLM异步多任务工具调用能力的基准,揭示延迟反馈对代理性能的显著影响。
Kou Shi, Ziao Zhang, Shiting Huang, Avery Nie, Zhen Fang, Qiuchen Wang, Lin...
2026-05-29
LLM代理
基准测试
多任务处理
工具调用
异步执行
为多奖励GRPO引入方差自适应权重,兼顾训练稳定与目标协同
Guochao Jiang, Jingyi Song, Guofeng Quan, Chuzhan Hao, Guohua Liu, Yuewei Zhang
2026-05-26
GRPO
LLM对齐
多奖励强化学习
工具调用
数学推理
首个支持单轮并行多工具调用的视频智能体RL框架PARA-GRPO,破解工具先验悖论。
Zuhao Yang, Kaichen Zhang, Sudong Wang, Keming Wu, Zhongyu Yang, Bo Li,...
2026-05-26
多模态大模型
工具调用
强化学习
智能体
长视频理解
提出基于验证器失败诊断的智能体-环境协同共演化框架 SEAL,用同一诊断信号同时驱动训练接口进化与策略梯度更新。
Yihao Hu, Zhihao Wen, Xiujin Liu, Pan Wang, Xin Zhang, Wei Wu
2026-05-26
GRPO
LLM智能体
失败诊断
工具调用
强化学习
训练4B RL编排器动态组合专家模型与层次技能,平均70.1%超越GPT-5
Jinyang Wu, Guocheng Zhai, Ruihan Jin, Yuhao Shen, Zhengxi Lu, Fan Zhang,...
2026-05-22
GRPO
POMDP
多模态智能体
工具调用
强化学习
提出工具编排视觉经验蒸馏,让图像生成智能体自我进化。
Sixiang Chen, Zhaohu Xing, Tian Ye, Xinyu Geng, Yunlong Lin, Jianyu Lai,...
2026-05-22
GRPO
图像生成智能体
多模态大模型
工具调用
强化学习
工具增强VLM智能体+统一视频DiT,解决视频编辑请求欠指定难题
Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao, Zhenghong Zhou, Hang Hua, Wei Xiong,...
2026-05-20
工具调用
扩散模型
智能体
视觉语言模型
视频编辑
提出 HarnessAudit 框架,把整个执行轨迹而非最终输出当作安全审计对象,并通过 210 个真实任务揭示主流 LLM Agent 系统在合规、执行、保稳三方面普遍存在的偏离。
Chengzhi Liu, Yichen Guo, Yepeng Liu, Yuzhe Yang, Qianqi Yan, Xuandong Zhao,...
2026-05-18
Agent 安全
LLM 评估
信息流控制
多 Agent 系统
工具调用
用检查表引导的自训练规划器+VLM奖励驱动的工具编排器,解决抽象长程图像编辑难题
Anirudh Sundara Rajan, Krishna Kumar Singh, Yong Jae Lee
2026-05-18
图像编辑
多模态大模型
工具调用
扩散模型
智能体
SLIM:把外部技能集当成可训练变量,动态增删扩展
Junhao Shen, Teng Zhang, Xiaoyan Zhao, Hong Cheng
2026-05-12
GRPO
LLM Agent
工具调用
强化学习
技能管理
首个把视觉证据当作搜索中枢而非终点来评测的多模态搜索基准。
Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li,...
2026-05-11
基准测试
多模态智能体
工具调用
智能体搜索
视觉-文本交错
用轮次分组归一化与自适应裁剪改进智能体强化学习的过程信用分配
Dingwei Chen, Zefang Zong, Zhipeng Ma, Leo Luo, Yang Li, Chengming Li, Peng...
2026-05-08
工具调用
强化学习
智能体大模型
策略优化
过程信用分配
NCBI/Ensembl/UniProt生物医学工具调用数据集,4B模型反超GPT-5.1
Xin Gao, Ruiyi Zhang, Meixi Du, Peijia Qin, Pengtao Xie
2026-05-08
LLM微调
工具调用
数据集
智能体
生物医学
首个开源多模态深度搜索智能体训练配方,含数据管线、七工具环境与致命感知GRPO
Shuang Chen, Kaituo Feng, Hangting Chen, Wenxuan Huang, Dasen Dai, Quanxin...
2026-05-07
GRPO
多模态智能体
工具调用
强化学习
数据合成
Z.ai发布原生多模态智能体基座,集成CogViT与多任务RL。
V Team, Wenyi Hong, Xiaotao Gu, Ziyang Pan, Zhen Yang, Yuting Wang, Yue...
2026-04-30
GUI Agent
多模态大模型
工具调用
强化学习
智能体