构建可控多模态乘法基准,用算术负荷C与强迫续写探针揭示多模态LLM的乘法失误源于计算而非感知。
Samuel G. Balter, Ethan Jerzak, Connor T. Jerzak
2026-04-21
可解释性
启发式策略
基准评测
多模态大模型
算术推理
用一阶 Taylor 展开精准识别 MLLM 中语言特异与跨模态共享神经元,仅微调关键子集实现图像翻译 SOTA。
Bo Li, Ningyuan Deng, Tianyu Dong, Shaobo Wang, Shaolin Zhu, Lijie Wen
2026-04-21
参数高效微调
图像翻译
多模态大模型
神经元可解释性
跨语言OCR
为多模态大模型打造长期个性化记忆体与性格演化机制的综合Agent框架。
Chang Nie, Chaoyou Fu, Yifan Zhang, Haihua Yang, Caifeng Shan
2026-04-20
个性化AI
多模态大模型
性格建模
智能体框架
检索增强生成
提出 AVR 框架,让视觉推理模型按任务复杂度动态选择直接回答、感知或完整推理三种格式,token 消耗降低 50–90%。
Yixu Huang, Tinghui Zhu, Muhao Chen
2026-04-20
GRPO
多模态大模型
强化学习
推理效率
视觉推理
把少量自监督任务伪装成指令,迫使多模态大模型真正用眼睛看。
Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc, Nicolas Thome,...
2026-04-17
LLaVA
多模态大模型
自监督学习
视觉中心推理
视觉指令微调
为多模态分割模型外挂实时检索,提升新兴实体分割精度19.2% gIoU
Song Tang, Guangquan Jie, Henghui Ding, Yu-Gang Jiang
2026-04-16
SAM
多模态大模型
开放世界分割
新兴实体分割
检索增强生成(RAG)
首个 UMM 统一代码库,标准化 15 个模型的评估与后训练,揭示架构统一≠表征统一。
Yinyi Luo, Wenwen Wang, Hayes Bai, Hongyu Zhu, Hao Chen, Pan He, Marios...
2026-04-14
后训练
基准测试
多模态大模型
架构-表征解耦
统一评估
提出一种区域级图结构表征 Distortion Graph,配套 528K 数据集与 PANDA 模型,让图像对失真评估从整体走向细粒度。
Muhammad Kamran Janjua, Abdul Wahab, Bahador Rashidi
2026-04-14
区域级理解
图像质量评估
图结构学习
多模态大模型
细粒度视觉评估
首个覆盖工件级与型号级细粒度语义的制造领域MLLM基准,揭示领域知识才是性能瓶颈。
Xiangru Jian, Hao Xu, Wei Pang, Xinjian Zhao, Chengyu Tao, Qixin Zhang,...
2026-04-13
制造领域
域自适应
基准评测
多模态大模型
工业AI
用皮尔士三元符号学重构人与生成艺术的意义流转,提出 SemJudge 和 HSG 图,让评估器真正看懂象征与暗示。
Ruixiang Jiang, Changwen Chen
2026-04-13
基准构建
多模态大模型
意义理解
生成艺术评估
计算符号学
用高斯分布匹配重写GRPO优势函数,破解多任务奖励拓扑不均衡。
Wenbo Hu, Xin Chen, Yan Gao-Tian, Yihe Deng, Nanyun Peng, Kai-Wei Chang
2026-04-10
GRPO
分布匹配
多模态大模型
强化学习
视觉推理
提出HDPO强化学习框架,解耦准确率与工具效率奖励,教会多模态智能体Metis“何时不用工具”。
Shilin Yan, Jintao Tong, Hongwei Xue, Xiaojun Tang, Yangyang Wang, Kunyu...
2026-04-10
GRPO
元认知
多模态大模型
工具使用
强化学习
6B参数SVLM做查询感知压缩器+ATA动态分词,刷新长视频理解SOTA。
Junjie Fei, Jun Chen, Zechun Liu, Yunyang Xiong, Chong Zhou, Wei Wen, Junlin...
2026-04-10
多模态大模型
查询感知
自适应Token分配
视频压缩
跨模态蒸馏
查询感知的两阶段自适应框架,让MLLM按需细化局部细节
Yuheng Shi, Xiaohuan Pei, Linfeng Wen, Minjing Dong, Chang Xu
2026-04-09
区域提议
多模态大模型
视觉感知
高效推理
提出三级层次和组基评估的视频理解基准,揭示SOTA模型与人类差距
Chaoyou Fu, Haozhi Yuan, Yuhao Dong, Yi-Fan Zhang, Yunhang Shen, Xiaoxing...
2026-04-08
基准测试
多模态大模型
视频理解
评估方法
Google 4B 医疗多模态模型,新增 3D 影像与时序分析能力
Andrew Sellergren, Chufan Gao, Fereshteh Mahvar, Timo Kohlberger, Fayaz...
2026-04-08
3D 影像
医疗 AI
多模态大模型
文档理解
病理 WSI
提出 SciTikZer 模型与 Dual Self-Consistency 强化学习框架,从图像生成可编译的 TikZ 代码,在 8B 体量上超越 Gemini-2.5-Pro 与 Qwen3-VL-235B。
Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu,...
2026-04-08
TikZ/LaTeX
代码生成
图像到代码
多模态大模型
强化学习
过程验证的多模态智能体基准,评估视觉扩展与知识扩展的协同能力。
Qianshan Wei, Yishan Yang, Siyi Wang, Jinglin Chen, Binyu Wang, Jiaming...
2026-04-06
基准测试
多模态大模型
工具使用
智能体评测
视觉推理
用反向几何变换搬运图像 token,使 MLLM 在单图条件下完成邻近视角的 3D 空间推理。
Phillip Y. Lee, Chanho Park, Mingue Park, Seungwoo Yoo, Juil Koo, Minhyuk Sung
2026-04-06
3D 空间推理
几何 warping
图像 token
多模态大模型
视角变换
提出 COSMIC 基准,评估两个 MLLM 代理能否通过多轮对话整合不同第一人称视角以形成共享空间心智模型。
Ankur Sikarwar, Debangan Mishra, Sudarshan Nikhil, Ponnurangam Kumaraguru,...
2026-04-06
多智能体协作
多模态大模型
对话基准
空间推理
认知地图