发现视频理解数据集严重依赖语言捷径,提出仅用视觉基础问题后训练提升模型性能
Yuxuan Zhang, EunJeong Hwang, Huaisong Zhang, Penghui Du, Yiming Jia, Dongfu...
2026-04-08
多模态学习
数据质量控制
视觉语言模型
视频理解
语言偏见
用数据工程而非架构创新,让1.2B小模型在文档解析上击败200倍参数的大模型。
Bin Wang, Tianyao He, Linke Ouyang, Fan Wu, Zhiyuan Zhao, Tao Chu, Yuan Qu,...
2026-04-07
OCR
强化学习
数据为中心AI
文档解析
视觉语言模型
提出完全开源的视觉推理训练方案,通过六类任务的多任务RL实现广泛能力提升
Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu
2026-04-07
多任务学习
开放源代码
强化学习
视觉推理
视觉语言模型
仅用最近N帧喂给现成VLM,即可超越复杂记忆机制的流式视频模型。
Yujiao Shen, Shulin Tian, Jingkang Yang, Ziwei Liu
2026-04-06
基线研究
感知-记忆权衡
流式视频理解
视觉语言模型
视频问答
揭示 VLM 靠语义标签“短路”视觉推理的失败机制
Haz Sameen Shahgir, Xiaofu Chen, Yu Fu, Erfan Shayegani, Nael Abu-Ghazaleh,...
2026-04-06
Logit Lens
可解释性
多模态推理
细粒度视觉感知
表征-输出差距
通过熵引导层选择+正交融合+RoPE交叉注意力整合SigLIP与DINO双编码器,让VLM在视觉理解与定位任务上同时提升约5%
Ankan Deria, Komal Kumar, Xilin He, Imran Razzak, Hisham Cholakkal, Fahad...
2026-04-06
多模态大模型
多编码器融合
自监督视觉表征
视觉定位
视觉语言模型
提出AutoMIA框架,自动发现并演化成员推理攻击策略,在多模型上超越人工设计基线。
Ruhao Liu, Weiqi Huang, Qi Li, Xinchao Wang
2026-04-03
大模型隐私
成员推理攻击
自动化攻击
视觉语言模型
闭环优化
用冻结LM做教师配合层间KV共享,在零额外参数下恢复VLM的语言能力。
Patrick Amadeus Irawan, Erland Hilman Fuadi, Shanu Kumar, Alham Fikri Aji,...
2026-04-03
KV缓存共享
多模态学习
灾难性遗忘
知识蒸馏
视觉语言模型
统一VLM框架,融合情景记忆+数据关联+探索策略,跨视角生成一致物体描述
Tommaso Galliena, Stefano Rosa, Tommaso Apicella, Pietro Morerio, Alessio...
2026-04-03
主动探索
具身智能
情景记忆
数据关联
物体描述生成
TAB框架将零样本3D视觉接地转化为动态的语义推理和几何重建过程
Haibo Wang, Zihao Lin, Zhiyang Xu, Lifu Huang
2026-04-02
3D视觉接地
多视图几何
智能体框架
视觉语言模型
零样本学习
使用单一早期融合Transformer实现开放词汇分割和OCR,通过Chain-of-Perception接口实现高效密集感知。
Aviraj Bevli, Sofian Chaybouti, Yasser Dahou, Hakim Hacid, Ngoc Dung Huynh,...
2026-04-01
OCR
密集感知
开放词汇分割
早期融合
视觉语言模型
通过掩码与门控融合,强制VLM利用几何token进行空间推理
Shihua Zhang, Qiuhong Shen, Shizun Wang, Tianbo Pan, Xinchao Wang
2026-03-31
3D几何
多模态学习
空间推理
视觉语言模型
视频理解
首个百万级多模态图表理解数据集,通过代码引导合成生成150万高质量图表样本
Jovana Kondic, Pengyuan Li, Dhiraj Joshi, Isaac Sanchez, Ben Wiesel, Shafiq...
2026-03-31
合成数据
图表理解
多模态学习
数据集构建
视觉语言模型
通过锚定令牌机制实现粗到精的视觉指向,提升VLM在图像、GUI和视频中的定位精度
Christopher Clark, Yue Yang, Jae Sung Park, Zixian Ma, Jieyu Zhang, Rohun...
2026-03-31
坐标表示
多模态推理
指向任务
视觉语言模型
锚定令牌
大规模视觉语言模型在手术工具检测任务上表现不佳,专业化小模型胜出
Kirill Skobelev, Eric Fithian, Yegor Baranovski, Jack Cook, Sandeep Angara,...
2026-03-31
医学影像
工具检测
手术AI
缩放定律
视觉语言模型
提出可审计运行时和全流程基准,评估医学AI在完整临床研究中的推理与证据提供能力。
Weixiang Shen, Yanzhu Hu, Che Liu, Junde Wu, Jiayuan Zhu, Chengzhi Shen, Min...
2026-03-30
全流程推理
医学影像
可审计性
智能体评测
视觉语言模型
提出包含多视角视频和多语言推理轨迹的自动驾驶长尾场景数据集与评估基准
Royden Wagner, Omer Sahin Tas, Jaime Villa, Felix Hauser, Yinzhe Shen,...
2026-03-30
推理轨迹
数据集
端到端驾驶
自动驾驶
视觉语言模型
用VLM将复杂科学图表转换为可编辑SVG,结合课程学习与强化学习
Qijia He, Xunmei Liu, Hammaad Memon, Ziang Li, Zixian Ma, Jaemin Cho, Jason...
2026-03-27
SVG生成
强化学习
矢量化
科学图表
视觉语言模型
提出CareFlow基准和CarePilot框架,实现医疗软件长视野任务自动化
Akash Ghosh, Tajamul Ashraf, Rishu Kumar Singh, Numan Saeed, Sriparna Saha,...
2026-03-26
GUI自动化
医疗AI
多智能体系统
视觉语言模型
长视野推理
扩散解码替代自回归,实现文档OCR并行生成与语义鲁棒
Hejun Dong, Junbo Niu, Bin Wang, Weijun Zeng, Wentao Zhang, Conghui He
2026-03-25
并行解码
扩散语言模型
文档OCR
视觉语言模型
课程学习