找到 102 条结果

通过层次化空间工具和双记忆系统,将空间推理重构为时空证据积累过程,显著提升VLM的空间理解能力。

Yalun Dai, Hao Li, Shulin Tian, Runmao Yao, Yuhao Dong, Fangzhou Hong,... 2026-06-19
3D理解 多模态智能体 工具使用 空间推理 视频理解

通过选择性协同学习解决视频对象分解中的编码器-解码器不匹配问题,提升性能并降低计算复杂度

WonJun Moon, Jae-Pil Heo 2026-06-19
对象中心学习 深度学习 自监督学习 视频理解

提出一种推理-再推理的两阶段框架,通过合成新视角视频验证初始假设,提升第一人称视频空间推理精度。

Chaofan Ma, Zhenjie Mao, Yuhuan Yang, Fanqin Zeng, Yue Shi, Yingjie Zhou,... 2026-06-11
3D几何 多模态大语言模型 空间推理 视频理解 跨视角验证

首个面向知识与推理密集型视频理解的大规模训练语料库,通过技能导向的QA生成框架和严格质量控制,显著提升模型在知识密集型视频推理任务上的表现

Lin Fu, Zheyuan Yang, Yang Wang, Tingyu Song, Arman Cohan, Yilun Zhao 2026-06-05
后训练 多模态学习 数据集构建 知识密集推理 视频理解

首个一对多时序定位框架,解决现实视频中重复事件定位问题

Qi Xu, Yue Tan, Shihao Chen, Jiahao Meng, Anna Wang, Shunping Ji, Hao Fei, Jason Li 2026-06-05
多模态大模型 强化学习 时序定位 视频理解

通过两阶段知识蒸馏,将字幕条件的帧相关性蒸馏到轻量级视觉模型,实现无需文本的高效视频关键帧选择

Killian Steunou, Anas Filali Razzouki, Khalil Guetari, Mounîm A. El-Yacoubi,... 2026-06-01
帧选择 排序学习 知识蒸馏 视频字幕生成 视频理解

通过视觉编码器内部帧合并和解耦空间选择,将视频LLM推理速度提升2.65倍

Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang 2026-05-29
Token压缩 推理加速 时域压缩 视频大语言模型 视频理解