找到 104 条结果

提出一种推理-再推理的两阶段框架,通过合成新视角视频验证初始假设,提升第一人称视频空间推理精度。

Chaofan Ma, Zhenjie Mao, Yuhuan Yang, Fanqin Zeng, Yue Shi, Yingjie Zhou,... 2026-06-11
3D几何 多模态大语言模型 空间推理 视频理解 跨视角验证

首个利用视频生成模型主动合成评测场景的MLLM时空推理基准,揭示当前模型从感知到高阶推理的性能鸿沟

Jinho Park, Youbin Kim, Hogun Park, Eunbyung Park 2026-05-25
主动合成 基准测试 多模态大语言模型 时空推理 视频生成

首个统一图像与视频的多模态大语言模型分割框架,支持14种分割任务与文本/视觉双提示。

Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang 2026-05-06
像素级理解 图像分割 多模态大语言模型 视频分割 通用基础模型