找到 67 条结果

用两阶段RL课程让多模态大模型自主掌握视觉工具调用以解决复杂视觉推理

Qihua Dong, Gozde Sahin, Pei Wang, Zhaowei Cai, Robik Shrestha, Hao Yang,... 2026-04-23
GRPO 多模态大模型 工具调用 强化学习 视觉推理

端到端语音模型集成推理与工具调用,任务完成率从34.88%提升至74.57%。

Tianle Liang, Yifu Chen, Shengpeng Ji, Yijun Chen, Zhiyang Jia, Jingyu Lu,... 2026-04-21
LLM智能体 多智能体系统 工具调用 思维链推理 端到端语音对话

通过筛选高方差轮次和功能等价奖励,将SFT轨迹转化为高效RL训练,实现4倍计算节省同时保持OOD泛化

Junkeun Yi, Damon Mosk-Aoyama, Baihe Huang, Ritu Gala, Charles Wang, Sugam... 2026-03-24
GRPO 后训练 大语言模型 工具调用 强化学习

4B参数医疗智能体通过行为蒸馏实现离线部署,性能媲美前沿大模型

Yixiong Chen, Xinyi Bai, Yue Pan, Zongwei Zhou, Alan Yuille 2026-03-12
医疗AI 多模态 工具调用 智能体 知识蒸馏

在不修改模型参数和系统提示的前提下,通过注入外部推理引导对话智能体从错误中恢复

Takyoung Kim, Jinseok Nam, Chandrayee Basu, Xing Fan, Chengyuan Ma, Heng Ji,... 2026-02-23
对话系统 工具调用 推理增强 测试时干预 错误恢复

提出GUI-Owl-1.5模型家族,通过混合数据飞轮和多平台RL扩展实现跨设备GUI自动化

Haiyang Xu, Xi Zhang, Haowei Liu, Junyang Wang, Zhaozai Zhu, Shengjie Zhou,... 2026-02-20
GUI Agent 多平台自动化 多模态大模型 工具调用 强化学习