找到 102 条结果

首个系统评估视频LLM实时交互能力的基准,覆盖记忆、感知与主动响应

Yansong Shi, Qingsong Zhao, Tianxiang Jiang, Xiangyu Zeng, Yi Wang, Limin Wang 2026-03-05
在线交互 基准测试 大语言模型 实时推理 视频理解

提出 MURGAT 基准,评估 MLLM 在复杂推理中为每个事实提供精确多模态引用的能力

David Wan, Han Wang, Ziyang Wang, Elias Stengel-Eskin, Hyunji Lee, Mohit Bansal 2026-02-13
可信AI 多模态大语言模型 归因与引用 视频理解 评估基准

提出Demo驱动的视频上下文学习任务与基准,通过两阶段训练提升MLLM从演示中学习新技能的能力

Yuhao Dong, Shulin Tian, Shuai Liu, Shuangrui Ding, Yuhang Zang, Xiaoyi... 2026-02-10
上下文学习 多模态大语言模型 教学视频 知识获取 视频理解

提出EGAgent框架,通过实体场景图实现跨天超长视频的多跳推理问答

Aniket Rege, Arka Sadhu, Yuliang Li, Kejie Li, Ramya Korlakai Vinayak,... 2026-01-27
场景图 多模态推理 智能体 检索增强生成 视频理解

结合稀疏标注与伪标签的视频上下文学习框架,实现低资源场景下的高效适应

Ryo Fujii, Hideo Saito, Ryo Hachiuma 2026-01-23
上下文学习 主动学习 伪标签 多模态大语言模型 少样本学习

构建1.47亿动作片段的大规模视频动作数据集,显著提升零样本动作识别性能

Delong Chen, Tejaswi Kasarla, Yejin Bang, Mustafa Shukor, Willy Chung, Jade... 2026-01-16
动作识别 数据集构建 自监督学习 视觉语言模型 视频理解

将动态点图扩展到视频级多视角,实现单次前向传播的4D场景重建

Edgar Sucar, Eldar Insafutdinov, Zihang Lai, Andrea Vedaldi 2026-01-16
3D重建 4D重建 前馈网络 动态场景 点图表示