用专用图像编辑器替代工具调用与统一多模态,让MLLM真正“用图像思考”。
Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin
2026-05-25
GRPO
LoRA微调
图像编辑
多模态大模型
强化学习
VideoRLVR框架用可验证奖励优化视频模型,提升规则验证任务的推理能力
Tinghui Zhu, Sheng Zhang, James Y. Huang, Selena Song, Xiaofei Wen, Yuankai...
2026-05-20
Flow-Matching
强化学习
扩散模型
视觉推理
视频生成
用词表里的功能 token 统一 agentic 与 latent 视觉推理。
Ziyu Guo, Rain Liu, Xinyan Chen, Pheng-Ann Heng
2026-05-15
GRPO
VLM
功能 token
强化学习
视觉推理
训练免费的提示框架,让VLM在原图上叠加SVG可视化注释来解释推理
Brandon Collins, Logan Bolton, Hung Huy Nguyen, Mohammad Reza Taesiri, Trung...
2026-04-28
SVG注释
人机交互
可解释AI
提示工程
视觉推理
用两阶段RL课程让多模态大模型自主掌握视觉工具调用以解决复杂视觉推理
Qihua Dong, Gozde Sahin, Pei Wang, Zhaowei Cai, Robik Shrestha, Hao Yang,...
2026-04-23
GRPO
多模态大模型
工具调用
强化学习
视觉推理
首个基于ART认知分类法评估MLLM视觉空间推理能力的合成基准,揭示人类与模型间30+个百分点的能力鸿沟。
Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti, Vineeth N...
2026-04-22
基准测试
多模态大语言模型
流体智能
视觉推理
认知科学
提出 AVR 框架,让视觉推理模型按任务复杂度动态选择直接回答、感知或完整推理三种格式,token 消耗降低 50–90%。
Yixu Huang, Tinghui Zhu, Muhao Chen
2026-04-20
GRPO
多模态大模型
强化学习
推理效率
视觉推理
用高斯分布匹配重写GRPO优势函数,破解多任务奖励拓扑不均衡。
Wenbo Hu, Xin Chen, Yan Gao-Tian, Yihe Deng, Nanyun Peng, Kai-Wei Chang
2026-04-10
GRPO
分布匹配
多模态大模型
强化学习
视觉推理
提出完全开源的视觉推理训练方案,通过六类任务的多任务RL实现广泛能力提升
Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu
2026-04-07
多任务学习
开放源代码
强化学习
视觉推理
视觉语言模型
过程验证的多模态智能体基准,评估视觉扩展与知识扩展的协同能力。
Qianshan Wei, Yishan Yang, Siyi Wang, Jinglin Chen, Binyu Wang, Jiaming...
2026-04-06
基准测试
多模态大模型
工具使用
智能体评测
视觉推理
将多模态智能体的交互轨迹解耦为原子级状态-动作经验,通过深度-广度搜索实现精准决策指导
Shijian Wang, Jiarui Jin, Runhao Fu, Zexuan Yan, Xingjian Wang, Mengkang Hu,...
2026-03-31
多模态智能体
工具使用
检索增强推理
经验学习
视觉推理
开源统一视频生成模型,融合多模态组合与推理能力,支持文本/图像/视频自由形式输入
Kaihang Pan, Qi Tian, Jianwei Zhang, Weijie Kong, Jiangfeng Xiong, Yanxin...
2026-03-26
多模态
扩散模型
统一模型
视觉推理
视频生成
MLLMs在离散符号理解中存在识别-推理倒置的认知错配现象
Yinghui Li, Jiayi Kuang, Peng Xing, Daixian Liu, Junnan Dong, Shu-Yu Guo,...
2026-03-20
基准测试
多模态大语言模型
符号理解
视觉推理
认知错配
通过迭代潜隐状态精炼实现扩散模型的内生链式思维推理
Xuanlang Dai, Yujie Zhou, Long Xing, Jiazi Bu, Xilin Wei, Yuhong Liu,...
2026-03-13
DiT
多模态大语言模型
扩散模型
视觉推理
链式思维推理
评估VLM细微视觉差异识别能力的基准,揭示时空推理与人类的显著差距
Minkyu Kim, Sangheon Lee, Dongmin Park
2026-03-11
基准测试
多模态
比较学习
视觉推理
视觉问答
评估多模态智能体长时序工具使用能力的现实视觉基准
Zhaochen Su, Jincheng Gao, Hangyu Guo, Zhenhua Liu, Lueyang Zhang, Xinyu...
2026-03-06
基准评估
多模态智能体
工具使用
视觉推理
长时序任务
首个覆盖7类推理、21项任务的真实生活多图像推理基准,揭示SOTA MLLM的巨大差距
Jiachun Li, Shaoping Huang, Zhuoran Jin, Chenlong Zhang, Pengfei Cao, Yubo...
2026-03-03
MLLM评估
基准评测
多图像理解
多模态推理
视觉推理
提出Ref-Adv基准测试,暴露MLLM在指代表达理解上对视觉捷径的依赖
Qihua Dong, Kuo Yang, Lin Ju, Handong Zhao, Yitian Zhang, Yizhou Wang,...
2026-03-02
基准测试
多模态大语言模型
指代表达理解
视觉定位
视觉推理
通过因果中介分析证明潜空间视觉推理方法无效,并提出基于文本想象的替代方案CapImagine
You Li, Chi Chen, Yanghao Li, Fanhu Zeng, Kaiyu Huang, Jinan Xu, Maosong Sun
2026-02-27
因果分析
多模态大语言模型
潜空间推理
视觉想象
视觉推理
用过采样-过滤-排序和累积工具奖励解决多模态RL训练中的交互坍缩问题
Shitian Zhao, Shaoheng Lin, Ming Li, Haoquan Zhang, Wenshuo Peng, Kaipeng...
2026-02-25
多模态模型
工具使用
强化学习
智能体
视觉推理