通过逐帧可靠性评估和置信度引导的工具调度,提升视频理解模型在真实损坏条件下的鲁棒性
Yangfan He, Yujin Choi, Jaehong Yoon
2026-06-26
多模态推理
工具学习
置信度估计
视频理解
鲁棒性
通过层次化空间工具和双记忆系统,将空间推理重构为时空证据积累过程,显著提升VLM的空间理解能力。
Yalun Dai, Hao Li, Shulin Tian, Runmao Yao, Yuhao Dong, Fangzhou Hong,...
2026-06-19
3D理解
多模态智能体
工具使用
空间推理
视频理解
通过选择性协同学习解决视频对象分解中的编码器-解码器不匹配问题,提升性能并降低计算复杂度
WonJun Moon, Jae-Pil Heo
2026-06-19
对象中心学习
深度学习
自监督学习
视频理解
首个在单个ViT中统一图像视频tokenization的UMM框架
Guozhen Zhang, Xuerui Qiu, Yutao Cui, Tianhui Song, Changlin Li, Junzhe Li,...
2026-06-12
图像理解
图像生成
图像编辑
多模态学习
统一模型
提出一种推理-再推理的两阶段框架,通过合成新视角视频验证初始假设,提升第一人称视频空间推理精度。
Chaofan Ma, Zhenjie Mao, Yuhuan Yang, Fanqin Zeng, Yue Shi, Yingjie Zhou,...
2026-06-11
3D几何
多模态大语言模型
空间推理
视频理解
跨视角验证
通过多模态上下文推理框架和高效注意力机制,实现长视频理解与智能Agent能力
Ziang Yan, Sheng Xia, Jiashuo Yu, Yue Wu, Tianxiang Jiang, Songze Li,...
2026-06-11
Agent系统
多模态推理
注意力优化
视频理解
长上下文
通过残差流适配器将预训练VLM离散解码扩展到精确连续预测
Zhuoming Liu, Jinhong Lin, Kwan Man Cheng, Lin Zhang, Shayok Bagchi, Yin Li
2026-06-11
机器人控制
流匹配
视觉语言模型
视频理解
连续解码
提出分层图记忆与智能检索机制,将长视频理解转化为多步智能探索任务,实现感知与推理解耦
Cong Chen, Guo Gan, Kaixiang Ji, ChaoYang Zhang, Zhen Yang, Guangming Yao,...
2026-06-10
分层记忆
多模态
智能体
视频理解
长视频
提出"观看-记住-推理"三重框架,系统梳理基于MLLM的视频理解方法、数据集、基准和未来方向
Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li,...
2026-06-08
多模态大语言模型
时序定位
视频推理
视频理解
记忆机制
首个面向知识与推理密集型视频理解的大规模训练语料库,通过技能导向的QA生成框架和严格质量控制,显著提升模型在知识密集型视频推理任务上的表现
Lin Fu, Zheyuan Yang, Yang Wang, Tingyu Song, Arman Cohan, Yilun Zhao
2026-06-05
后训练
多模态学习
数据集构建
知识密集推理
视频理解
首个一对多时序定位框架,解决现实视频中重复事件定位问题
Qi Xu, Yue Tan, Shihao Chen, Jiahao Meng, Anna Wang, Shunping Ji, Hao Fei, Jason Li
2026-06-05
多模态大模型
强化学习
时序定位
视频理解
将视频编码的I/P帧思想引入MLLM,用运动-残差token大幅降低视觉token成本
Haowen Hou, Zhen Huang, Zheming Liang, Qingyi Si, Chenglin Li, Shuai Dong,...
2026-06-05
多模态LLM
视频理解
预测编码
高效推理
通过Perceiver超网络将视频编码为LoRA适配器,实现零视觉token的视频问答。
Manan Suri, Sarvesh Baskar, Dinesh Manocha
2026-06-05
参数高效微调
多模态学习
视觉语言模型
视频理解
超网络
GeoVR 通过从2D视频提取几何约束,零推理成本赋予MLLMs强大的3D空间感知能力。
Haibo Wang, Lifu Huang
2026-06-05
3D空间推理
几何表示学习
多模态大语言模型
知识蒸馏
视频理解
首个全人工标注的流式空间智能基准,揭示多模态大模型在自我中心视频流上的空间推理巨大缺口。
Yifei Li, Pengyiang Liu, Yuhang Zang, Zhongyue Shi, Qi Fu, Hongye Hao, Jiwen Lu
2026-06-04
CoT思维链
具身智能
基准测试
多模态大模型
流式空间智能
首个系统评测多模态模型视频记忆能力的认知心理学基准。
Jie Huang, Ruixun Liu, Sirui Sun, Xinyi Yang, Yin Li, Yixin Zhu, Yiwu Zhong
2026-06-04
多模态记忆
工作记忆
注意力机制
视觉语言模型
视频理解
VSTAT:834视频1500问题诊断MLLM的视觉状态跟踪能力
Sihyun Yu, Nanye Ma, Pinzhi Huang, Hyunseok Lee, Shusheng Yang, June Suk...
2026-06-03
MLLM评测
基准测试
多模态大模型
视觉状态跟踪
视频理解
首个多流流媒体理解基准,评估MLLMs的并发流处理能力
Peiwen Sun, Xudong Lu, Huadai Liu, Yang Bo, Dongming Wu, Huankang Guan,...
2026-06-02
基准测试
多模态大语言模型
多流理解
流媒体理解
视频理解
通过两阶段知识蒸馏,将字幕条件的帧相关性蒸馏到轻量级视觉模型,实现无需文本的高效视频关键帧选择
Killian Steunou, Anas Filali Razzouki, Khalil Guetari, Mounîm A. El-Yacoubi,...
2026-06-01
帧选择
排序学习
知识蒸馏
视频字幕生成
视频理解
通过视觉编码器内部帧合并和解耦空间选择,将视频LLM推理速度提升2.65倍
Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang
2026-05-29
Token压缩
推理加速
时域压缩
视频大语言模型
视频理解