提出首个面向多Agent环境感知评测的端到端基准,包含2.4K高密度标注的多视点游戏视频QA对,揭示MLLM在时序推理和跨视频理解上的显著不足。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用结构化文本描述3D空间布局作为中间推理链,提升MLLM的空间推理准确率
AutoGaze:3M参数前置模块裁剪冗余patch,实现19×加速
将查询分解为逻辑树,用轻量专家做多模态帧选择,无需训练即可超越迭代方法
基于视频的2D VLM框架,实现语言定位与视角感知3D推理
提出Chain of Events范式,通过构建时序事件链提升MLLM的视频事件预测能力
通过将预测损失扩展到所有token并引入深层自监督,大幅提升视频自监督学习的密集特征质量
Video-SFT提升视频理解但损害图像能力,本文揭示这一"时间陷阱"并提出混合帧策略缓解
STTS 在 ViT 和 LLM 中统一剪枝视觉 token,50% 剪枝提速 62%
首个视频到网页生成基准,用细粒度视觉评分标准评估MLLM复现能力
2万题音视频联合推理基准,揭示最强模型仅64.2%准确率
VLM在视觉实体追踪任务上接近随机猜测,SGCoT推理链突破90%准确率
VST让视频大模型在流式观看时同步推理,兼顾实时响应与深度思考
提出分段级记忆机制实现流式视频多轮问答,解耦感知与生成
用测试时训练在线更新快权重,实现长视频流式空间理解
基于视频的计算机使用代理奖励建模
👍 43用执行视频训练奖励模型评估计算机代理任务成功率
统一因果时空注意力视觉骨干,支持流式感知、几何重建与具身控制
ROVA框架通过结构化时空扰动与自反思难度调度,提升视频推理在真实世界扰动下的鲁棒性
用文本LLM初始化视觉编码器替代CLIP,紧凑模型达SOTA
提出主动式视频理解框架,让AI像人类解说员一样自主决定何时开口、说什么。