首个系统评估视频LLM实时交互能力的基准,覆盖记忆、感知与主动响应
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出SVG2数据集与TraSeR模型,自动生成视频时空场景图
首个统一评估视频基础模型理解、生成、编辑和重构能力的综合基准
提出统一前馈框架,从单目视频联合重建4D几何与运动
提出结构化属性指令数据集ASID-1M和验证管道,显著提升视频描述的细粒度和可靠性
借鉴HEVC视频编解码器思想,只编码视频中3.1%-25%的运动关键区域实现高效视觉理解
通过视频编解码原语(运动向量和残差)实现高效视频语言建模,将token使用量减少93%
面向可验证推理的多模态事实级归因
👍 4提出 MURGAT 基准,评估 MLLM 在复杂推理中为每个事实提供精确多模态引用的能力
提出OmniDenseCaptioning任务,生成六维度剧本式视频描述
提出Demo驱动的视频上下文学习任务与基准,通过两阶段训练提升MLLM从演示中学习新技能的能力
提出模态非对称token压缩框架,先修剪视频冗余再视觉引导音频选择,显著提升Omni-LLMs效率
首个结合原生音频-视频输入、时序定位和人口统计学元数据的多模态理解基准
智能体驱动的超长视频理解
👍 22提出EGAgent框架,通过实体场景图实现跨天超长视频的多跳推理问答
结合稀疏标注与伪标签的视频上下文学习框架,实现低资源场景下的高效适应
首个完全开放的视频视觉语言模型,支持视频定位、跟踪和密集描述,性能超越专有模型
构建1.47亿动作片段的大规模视频动作数据集,显著提升零样本动作识别性能
V-DPM:基于动态点图的4D视频重建
👍 11将动态点图扩展到视频级多视角,实现单次前向传播的4D场景重建
统一框架实现视频时空联合理解,SlowFast token+MLLM-SAM2架构
首个视频深度研究基准,要求模型结合视频线索与开放网络进行多跳推理
提出自适应视频推理框架,只在必要时进行CoT推理,大幅提升效率同时保持准确率