首尾片段完形填空式评测揭示视频LLM的时序对齐瓶颈
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
并行管解码:面向视频的高效生成式时空定位
👍 16把时空管解码深度压到固定1+1轮,延迟降79倍、吞吐升92倍且精度更优。
首个系统评测视频指令遵循的基准:20余模型中最强者仅得54.5分
把LLM前馈层改造成任务专家,任务级路由让1B模型超越8B基线且可即插即拔增删任务。
细粒度MoE+核优化+防遗忘视频微调,稀疏CLIP视觉编码器追平1.7倍大的SOTA稠密模型
把视频理解重构为多轮工具增强任务,20个前沿模型全部低于60%准确率
训练时预测未来视觉嵌入、推理时直接作答,精度持平或超越Visual CoT且延迟降5倍以上
视频全局空间感知基准,揭示最强VLM仍落后人类36分,定向训练可大幅缩小差距。
构建CGV儿童步态数据集,提出ChildGait-Video从RGB视频自动评估EVGS
训练单个可学习令牌在值空间检索,让VLM精准定位长视觉上下文中的相关帧。
免训练的模态解耦Token压缩框架,共享查询但独立估计各模态显著性,实现3.53倍预填充加速
编解码器原生视觉tokenizer+事件门控,4B参数实时流式多模态模型
面向开放视频流的实体导向多模态记忆系统
👍 28实体导向的多模态长期记忆系统,感知流并围绕实体组织记忆,六项基准全部最优
全开源音视频大模型,专为长复杂视频设计,三阶段课程加时间接地链式推理
首个由盲人实拍、覆盖主动提醒/问答/交互三大任务的在线视频评测基准
提出诊断套件审核基准测试,发现55%样本存在捷径,暴露Video-LLM真正差距
缓解零样本组合动作识别中的物体驱动捷径
👍 50通过共现先验正则化和时间顺序正则化缓解ZS-CAR中的物体驱动捷径
通过双上下文状态实现低延迟、高效率的长视频理解
首个评估MLLM视听艺术理解能力的综合基准,揭示模型在艺术意图推理方面的显著短板
提出可控基准评估视频时间逻辑推理能力,揭示模型与人类巨大差距