首个工业产品多图像理解基准,揭示MLLM跨图像整合瓶颈
Haonan Qi, Jin Cao, Yongqi Zhang, Xintong Wang, Weidong Tang, Bin Chen,...
2026-06-18
基准测试
多模态大模型
属性提取
工业AI
提出实体锚定脚本+线索引导QA两阶段自动数据引擎,构建10万条跨模态长程推理样本。
Xinyue Cai, Chaoyou Fu, Yi-Fan Zhang, Ran He, Caifeng Shan
2026-06-15
多模态大模型
指令微调
数据合成
跨模态推理
音视频理解
首个系统实证 MLLM 视觉仓库表示,图谱补充可降 26% token 成本。
Dongjian Ma, Silin Chen, Yufei Yang, Yulin Shi, Yanfu yan, Xiaodong Gu
2026-06-15
MLLM
SWE-bench
代码仓库
多模态大模型
视觉-文本混合
首个统一评估MLLM代码化参数化3D生成能力的基准,覆盖文本/图像/装配三类任务。
Yikang Yang, Zhanpeng Hu, Youtian Lin, Mengqi Zhou, Jingxi Xu, Feihu Zhang,...
2026-06-15
CAD代码生成
参数化3D生成
基准测试
多模态大模型
结构推理
用世界坐标系认知地图+三阶段工具调用 Harness,把 MFM 空间推理提升 5%–18%
Shouwei Ruan, Bin Wang, Zhenyu Wu, Qihui Zhu, Yuxiang Zhang, Jingzhi Li,...
2026-06-15
多模态大模型
强化学习
智能体工具调用
空间推理
认知地图
利用Fisher-Rao距离检测注意力转移,动态重加权token级优势以提升MLLM跨模态推理。
Hangui Lin, Yan Shu, Zhengyang Liang, Chi Liu, Xiangrui Liu, Minghao Qin,...
2026-06-11
多模态大模型
强化学习
注意力机制
视觉推理
跨模态协调
通过移除连续截图中的冗余视觉token,提升CUA长视距任务性能并降低计算成本
Amirhossein Abaskohi, Yuhang He, Peter West, Giuseppe Carenini, Pranit...
2026-06-11
冗余消除
多模态大模型
视觉token压缩
计算机使用代理
长视距推理
首个支持256K上下文的开源MoE多模态大模型,专注于长视频理解和智能体能力
Kwai Keye Team, Bin Wen, Changyi Liu, Chengru Song, Chongling Rao, Guowang...
2026-06-10
RLHF
多模态大模型
智能体
混合专家
稀疏注意力
通过构建场景记忆和技能库,学习场景感知的工具使用技能,解决 MLLM 智能体在 3D 空间推理中的工具误用问题
Haoyuan Li, Zhengdong Hu, Jun Wang, Hehe Fan, Yi Yang
2026-06-09
3D 空间推理
多模态大模型
工具使用
技能学习
智能体
首个一对多时序定位框架,解决现实视频中重复事件定位问题
Qi Xu, Yue Tan, Shihao Chen, Jiahao Meng, Anna Wang, Shunping Ji, Hao Fei, Jason Li
2026-06-05
多模态大模型
强化学习
时序定位
视频理解
提出始终在线的流式音频交互模型,统一离线与实时音频任务。
Zhifei Xie, Zihang Liu, Ze An, Xiaobin Hu, Yue Liao, Ziyang Ma, Dongchao...
2026-06-04
多模态大模型
实时交互
流式推理
语音对话
语音识别
首个全人工标注的流式空间智能基准,揭示多模态大模型在自我中心视频流上的空间推理巨大缺口。
Yifei Li, Pengyiang Liu, Yuhang Zang, Zhongyue Shi, Qi Fu, Hongye Hao, Jiwen Lu
2026-06-04
CoT思维链
具身智能
基准测试
多模态大模型
流式空间智能
用宽基线匹配任务评估并通过课程强化学习提升 MLLM 空间推理
Hao Zhong, Muzhi Zhu, Shenyan Zeng, Anzhou Li, Cong Chen, Hua Geng, Duochao...
2026-06-04
多模态大模型
宽基线匹配
强化学习(RLVR)
空间推理
视觉对应
把网页生成评测改写为需求诱导的可观察状态转移契约。
Yuxin Meng, Yuhan Suo, Junjie Wang, Yuhan Sun, Yiyao Yu, Ruixu Zhang,...
2026-06-04
ICG
交互式评测
前端代码生成
多模态大模型
浏览器 Agent
首个评估VLM代理在3D场景中基于行动反馈的空间推理能力的基准测试
Tianhui Liu, Jie Feng, Zhiheng Zheng, Shengyuan Wang, Yiming Guo, Yanxin Xi,...
2026-06-04
3D场景理解
基准测试
多模态大模型
智能体交互
空间推理
VSTAT:834视频1500问题诊断MLLM的视觉状态跟踪能力
Sihyun Yu, Nanye Ma, Pinzhi Huang, Hyunseok Lee, Shusheng Yang, June Suk...
2026-06-03
MLLM评测
基准测试
多模态大模型
视觉状态跟踪
视频理解
让MLLM学会何时调用、验证、信任世界模型的视频推演来预测未来。
Yucheng Zhou, Wei Tao, Yiwen Guo, Jianbing Shen
2026-06-03
世界模型
多模态大模型
工具调用
强化学习
推理
用520个可规则验证的在线生成器-验证器环境,为视觉推理RL提供无限新鲜训练信号。
Tianze Yang, Yucheng Shi, Ruitong Sun, Jingyuan Huang, Ninghao Liu, Jin Sun
2026-06-03
DAPO
VLM后训练
多模态大模型
强化学习RLVR
程序化生成
构建合成可信度基准,揭示现有检测器与人类在此新威胁上普遍失效。
Junxiao Yang, Minghao Zhang, Xiaoce Wang, Haoran Liu, Shiyao Cui, Hongning...
2026-06-03
AIGC检测
内容溯源
基准测试
多模态大模型
视觉安全
从fMRI脑信号直接回答视觉问题,并附NSD-VQA受控新基准。
Roman Beliy, Matias Cosarinsky, Oliver Heinimann, Navve Wasserman, Michal Irani
2026-06-02
InstructBLIP
fMRI脑解码
多模态大模型
神经科学
脑机接口