首个以交互为中心的视频世界模型评测基准,揭示当前模型在因果一致性和物理交互上的核心短板。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过感知约束的动态缓存,将视频世界模型推理速度提升2.3倍同时保持99.4%质量
用PDE动力学替代注意力机制,实现O(N)复杂度的世界模型预测
EgoForge 仅凭单张自我中心图像+高层指令+可选外中心图,生成目标驱动的连贯第一人称视频
融合显式3D与隐式注意力的Patch级混合空间记忆机制
通过将预测损失扩展到所有token并引入深层自监督,大幅提升视频自监督学习的密集特征质量
通过因果注意力掩码将视频预测变为可选,实现9倍推理加速且不损失性能
立体世界模型:相机引导的立体视频生成
👍 11首个相机条件约束的立体世界模型,联合学习外观与双目几何,实现端到端立体视频生成
通过运动学控制机器人+4D扩散模型生成环境反应,实现高保真具身仿真
用相机位姿统一动作控制与3D一致性,构建交互式游戏世界模型
基于真实世界的城市场景世界模拟模型:首尔世界模型
👍 155首尔世界模型:用街景图像检索增强,实现真实城市级别的世界模拟视频生成
首个统一遥感世界模型,联合时空变化理解和未来场景预测,2B参数超越120×大模型
基于因子化世界状态的奖励预测
👍 2通过将观测分解为对象-属性结构,实现零样本跨域奖励预测
提出两阶段训练与一致性蒸馏,实现动作一致的高速导航世界模型
将每张图像压缩至8个离散token,使世界模型规划速度提升40倍且精度不降
基于曲率的异构 token 缓存框架,实现扩散世界模型最高 3.7 倍加速且保持 98% 生成质量
通过联合建模多源世界知识(运动、语义、几何),实现物理一致的视频生成。
首个端到端自监督物体中心世界模型,提出每粒子潜在动作实现可扩展多物体随机视频预测与决策。
超越语言建模:多模态预训练的探索
👍 107从零开始系统研究统一多模态预训练的设计空间,揭示视觉与语言的互补性和缩放不对称性
下一嵌入预测使世界模型更强大
👍 21用因果Transformer预测下一时刻嵌入,替代像素重建学习世界模型