找到 60 条结果

用专用图像编辑器替代工具调用与统一多模态,让MLLM真正“用图像思考”。

Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin 2026-05-25
GRPO LoRA微调 图像编辑 多模态大模型 强化学习

VideoRLVR框架用可验证奖励优化视频模型,提升规则验证任务的推理能力

Tinghui Zhu, Sheng Zhang, James Y. Huang, Selena Song, Xiaofei Wen, Yuankai... 2026-05-20
Flow-Matching 强化学习 扩散模型 视觉推理 视频生成

用两阶段RL课程让多模态大模型自主掌握视觉工具调用以解决复杂视觉推理

Qihua Dong, Gozde Sahin, Pei Wang, Zhaowei Cai, Robik Shrestha, Hao Yang,... 2026-04-23
GRPO 多模态大模型 工具调用 强化学习 视觉推理

提出 AVR 框架,让视觉推理模型按任务复杂度动态选择直接回答、感知或完整推理三种格式,token 消耗降低 50–90%。

Yixu Huang, Tinghui Zhu, Muhao Chen 2026-04-20
GRPO 多模态大模型 强化学习 推理效率 视觉推理

提出完全开源的视觉推理训练方案,通过六类任务的多任务RL实现广泛能力提升

Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu 2026-04-07
多任务学习 开放源代码 强化学习 视觉推理 视觉语言模型

将多模态智能体的交互轨迹解耦为原子级状态-动作经验,通过深度-广度搜索实现精准决策指导

Shijian Wang, Jiarui Jin, Runhao Fu, Zexuan Yan, Xingjian Wang, Mengkang Hu,... 2026-03-31
多模态智能体 工具使用 检索增强推理 经验学习 视觉推理