通过熵引导层选择+正交融合+RoPE交叉注意力整合SigLIP与DINO双编码器,让VLM在视觉理解与定位任务上同时提升约5%
Ankan Deria, Komal Kumar, Xilin He, Imran Razzak, Hisham Cholakkal, Fahad...
2026-04-06
多模态大模型
多编码器融合
自监督视觉表征
视觉定位
视觉语言模型
500题+5级层次化评估协议,证明主流视频MLLM在长视频细粒度时空证据定位上几乎全部失败(Level-5最高仅1%)。
Jiahao Meng, Tan Yue, Qi Xu, Haochen Wang, Zhongwei Ren, Weisong Liu, Yuhao...
2026-04-03
Thinking-with-Videos
基准测试
多模态大模型
时空定位
视频理解
用稀疏自编码器定位昆虫部位,再让多模态大模型生成可解释的形态特征描述。
Vardaan Pahuja, Samuel Stevens, Alyson East, Sydne Record, Yu Su
2026-04-03
多模态大模型
弱监督定位
形态学
特征提取
生物多样性
美团 LongCat 团队提出 DiNA 范式,把视觉/音频也词表化为离散 token,用统一自回归统一多模态。
Meituan LongCat Team, Bin Xiao, Chao Wang, Chengjiang Li, Chi Zhang, Chong...
2026-04-01
MoE
原生多模态
多模态大模型
离散 token 化
自回归
首个基于掩码扩散的8B全模态统一模型,在单一架构中实现文本、图像、语音、视频的任意理解与生成
Jaeik Kim, Woojin Kim, Jihwan Hong, Yejoon Lee, Sieun Hyeon, Mintaek Lim,...
2026-04-01
全模态统一
多模态大模型
扩散模型
掩码扩散
文本-图像-语音联合建模
首个无模板的单目RGB视频4D手-铰接物体重建框架,MLLM引导对齐。
Zikai Wang, Zhilu Zhang, Yiqing Wang, Hui Li, Wangmeng Zuo
2026-04-01
4D重建
基础模型
多模态大模型
手-物体交互
铰接物体
提出基于VQA的自动化评估框架CREval和基准CREval-Bench,解决复杂创意图像编辑的评估难题
Chonghuinan Wang, Zihan Chen, Yuxiang Wei, Tianyi Jiang, Xiaohe Wu, Fan Li,...
2026-04-01
VQA评估
图像编辑
基准测试
多模态大模型
自动评估
提出智能工作流构建大规模结肠镜病变数据集,评估MLLM医学视频理解能力
Abdullah Hamdi, Changchun Yang, Xin Gao
2026-04-01
医学影像
多模态大模型
病灶检测
结肠镜检查
视频标注
将对话历史音频压缩为固定latent tokens,降低成本同时保留ASR增益
Shashi Kumar, Esaú Villatoro-Tello, Sergio Burdisso, Kadri Hacioglu,...
2026-04-01
上下文感知
多模态大模型
对话系统
模型压缩
语音识别
通过提取VLM扩散模型中间层特征注入3D生成,实现背面语义可控
Wenyue Chen, Wenjue Chen, Peng Li, Qinghe Wang, Xu Jia, Heliang Zheng,...
2026-03-30
3D生成
单视图重建
多模态大模型
扩散模型
语义控制
首个万亿参数科学多模态MoE模型,突破100+科学任务
Yicheng Zou, Dongsheng Zhu, Lin Zhu, Tong Zhu, Yunhua Zhou, Peiheng Zhou,...
2026-03-27
多模态大模型
强化学习
模型扩展
混合专家模型MoE
科学AI
两阶段自进化框架训练4B模型达81%成功率,超越人类水平
Zichuan Lin, Feiyu Liu, Yijun Yang, Jiafei Lyu, Yiming Gao, Yicheng Liu,...
2026-03-26
GUI智能体
多模态大模型
强化学习
移动端自动化
自进化学习
提出首个面向多Agent环境感知评测的端到端基准,包含2.4K高密度标注的多视点游戏视频QA对,揭示MLLM在时序推理和跨视频理解上的显著不足。
Yunzhe Wang, Runhui Xu, Kexin Zheng, Tianyi Zhang, Jayavibhav Niranjan...
2026-03-26
基准评测
多Agent系统
多模态大模型
幻觉检测
时序推理
首个支持流式视频中动态注册个性化概念并实时问答的免训练框架与基准
Yuanhong Zheng, Ruichuan An, Xiaopeng Lin, Yuxing Liu, Sihan Yang, Huanyu...
2026-03-25
个性化理解
多模态大模型
实时交互
检索增强
流式视频
PEPO:通过视觉感知与探索耦合的token级优势估计优化多模态推理
Yunheng Li, Hangyi Kuang, Hengrui Zhang, Jiangxia Cao, Zhaojie Liu, Qibin...
2026-03-25
多模态大模型
强化学习
推理优化
策略梯度
视觉语言模型
用特征轨迹的曲率作为语义变化的几何探针,把流式视频帧动态路由进高清清晰记忆与低分辨率模糊记忆,在严格 token 预算下取得超 10% 的绝对提升。
Chao Wang, Xudong Tan, Jianjian Cao, Kangcong Li, Tao Chen
2026-03-23
几何曲率
多模态大模型
流式视频理解
训练免调
记忆管理
VTC-Bench:基于32种OpenCV工具和680题,评估MLLM的视觉工具链能力。
Xuanyu Zhu, Yuhao Dong, Rundong Wang, Yang Shi, Zhipeng Wu, Yinlun Peng,...
2026-03-20
基准测试
多模态大模型
智能体
视觉工具调用
计算机视觉
将长视频理解为分层环境导航,实现O(log T)计算复杂度的零样本视频问答
Mohamed Eltahir, Ali Habibullah, Yazan Alshoibi, Lama Ayash, Tanveer...
2026-03-19
分层表示
多模态大模型
智能体
递归语言模型
长视频理解
揭示MLLM细粒度幻觉,提出FINER-Tuning提升准确率24.2%
Rui Xiao, Sanghwan Kim, Yongqin Xian, Zeynep Akata, Stephan Alaniz
2026-03-19
DPO微调
多模态大模型
幻觉检测
细粒度推理
负查询
揭示多模态大模型在心电图解释中缺乏真正的临床推理能力
Jungwoo Oh, Hyunseung Chung, Junhee Lee, Min-Gyu Kim, Hangyul Yoon, Ki Seong...
2026-03-18
临床推理
医疗AI
多模态大模型
心电图解释
评估基准