首个统一评估视频世界模型物理、几何、交互能力的综合基准测试
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
多块预测框架解决自回归视频世界模型训练中的短视监督问题
通过分层token化和粗到细rollout实现长视频生成的一致性
提出基于时间距离的自适应KV缓存压缩方法,在固定预算下实现长视频的一致性生成
视频世界模型的潜在空间记忆
👍 71在潜在空间直接构建3D记忆,实现高效几何一致的视频生成
首个针对组合式视频编辑的基准测试,揭示当前模型在复杂多指令场景下的严重缺陷。
通过固定backbone对照研究视频世界模型中四种记忆机制
将视频世界模型从相机导航扩展到对象级轨迹控制,实现相机与对象操作的组合控制
通过混合视图动作控制和锚点视图定制实现可交互、可演化的第一人称世界模拟
发现2步推理比50步推理物理一致性更好,提出PhaseLock保留运动先验
统一力表示+因果蒸馏实现实时力控流式视频生成
5B参数的高效统一视频生成编辑框架,推理速度提升5.4倍
提出首个评估视频生成模型物理可执行性的基准测试框架,通过模拟器中的实际执行成功来衡量模型的物理知识。
用一个 Mixture-of-Transformers 统一语言/图像/视频/音频/动作的理解与生成
用可学习的演化记忆查询实现实时无限长视频生成。
用双向判别器与分布匹配预热实现单步自回归视频生成,解决运动坍缩与训练不稳定。
VLM-as-Teacher范式,通过测试时优化提升视频推理能力
首个将MLA应用于视频扩散的工作,压缩KV缓存92.7%同时保持长时生成质量
通过检索历史生成内容解决AR长视频生成的错误累积问题
用团队体育作动态微观世界,构建覆盖感知到智能体合成的战略视频智能基准