把BEV表征、LLM语义推理和未来点云预测整合到一个框架中,让语言理解直接指导几何演化。
Xin Zhou, Dingkang Liang, Xiwu Chen, Feiyang Tan, Dingyuan Zhang, Hengshuang...
2026-05-07
BEV表征
世界模型
点云预测
自动驾驶
视觉-语言模型
用第三人称视频生成作为中间表征,把任务指令转化为可执行的人形机器人行为,无需任务专属数据采集。
Yanghao Zhou, Jingyu Ma, Yibo Peng, Zhenguo Sun, Yu Bai, Börje F. Karlsson
2026-05-01
世界模型
人形机器人控制
具身智能
视频生成
零样本泛化
X-WAM:统一4D世界动作模型,联合预测多视角RGB-D视频与机器人动作
Jun Guo, Qiwei Li, Peiyan Li, Zilong Chen, Nan Sun, Yifei Su, Heyun Wang,...
2026-04-30
4D重建
VLA
世界模型
具身智能
扩散模型
用强化学习把视频生成模型对齐 3D 几何,无需改架构即可获得 3D 一致性
Weijie Wang, Xiaoxuan He, Youping Gu, Yifan Yang, Zeyu Zhang, Yefei He,...
2026-04-28
3D 一致性
Flow-GRPO
世界模型
强化学习
文本到视频生成
DeFI:将视频预测与动作推理解耦预训练,再端到端融合实现高效通用机器人策略。
Wenyao Zhang, Bozhou Zhang, Zekun Qi, Wenjun Zeng, Xin Jin, Li Zhang
2026-04-28
世界模型
机器人学习
模仿学习
视觉-语言-动作模型
视频生成
提出 L1/L2/L3 三级能力 × 物理/数字/社会/科学四规律的二维世界建模分类法
Meng Chu, Xuan Billy Zhang, Kevin Qinghong Lin, Lingdong Kong, Jize Zhang,...
2026-04-27
AI for Science
世界模型
强化学习
智能体
理论框架
用离散扩散统一视觉-语言-动作token,自动打分评估机器人策略
Yaxuan Li, Zhongyi Zhou, Yefei Chen, Yaokai Xue, Yichen Zhu
2026-04-27
VLA
世界模型
机器人
离散扩散
策略评估
为交互式视频世界模型提供标准化场景、统一动作接口与多维评估工具
Xiaojie Xu, Zhengyuan Lin, Kang He, Yukang Feng, Xiaofeng Mao, Yuanyang Yin,...
2026-04-24
世界模型
交互式生成
图像到视频
基准测试
视频生成
通过视觉锚定的三支路交叉重建,将异构人类与机器人动作投影到共享离散潜在空间,统一服务策略与世界模型
Boyu Chen, Yi Chen, Lu Qiu, Jerry Bai, Yuying Ge, Yixiao Ge
2026-04-24
世界模型
人形机器人
潜在动作表示
视觉-语言-动作模型
跨本体学习
用视觉隐空间世界模型给VLA加上前瞻规划,实现工业机械臂零人工干预
Adriana Aida, Walida Amer, Katarina Bankovic, Dhruv Behl, Fabian Busch,...
2026-04-23
世界模型
工业部署
机器人操作
流匹配
视觉-语言-动作模型
用世界模型辅助的视觉-语言双解码器监督潜在 CoT,让自动驾驶规划在答案级延迟下超越显式 CoT。
Jinghui Lu, Jiayi Guan, Zhijian Huang, Jinlong Li, Guang Li, Lingdong Kong,...
2026-04-21
世界模型
思维链压缩
潜在推理
端到端规划
自动驾驶
先把 VFM 语义特征自回归预测出来,再用扩散模型渲染像素,实现 7× 训练加速。
Efstathios Karypidis, Spyros Gidaris, Nikos Komodakis
2026-04-17
世界模型
分层生成
扩散模型
自动驾驶
视觉基础模型
ZWM用单儿童868小时第一人称视频训练,无需任务标签即可零样本完成光流/深度/分割/物理推理
Khai Loong Aw, Klemen Kotar, Wanhee Lee, Seungwoo Kim, Khaled Jedoui, Rahul...
2026-04-14
世界模型
儿童视觉发育
因果推断
脑-模型对齐
自监督学习
通过两阶段框架学习 64× 时间压缩的稠密运动潜空间,使目标条件运动生成比视频模型快 4 个数量级。
Nick Stracke, Kolja Bauer, Stefan Andreas Baumann, Miguel Angel Bautista,...
2026-04-14
世界模型
流匹配
潜空间学习
目标条件生成
运动生成
用稀疏点轨迹的逐步自回归扩散,从单张图像生成上千种物理一致的开集未来预测,比视频生成快几个数量级。
Stefan Andreas Baumann, Jannik Wiese, Tommaso Martorella, Mahdi M. Kalayeh,...
2026-04-13
世界模型
扩散模型
稀疏表示
自回归Transformer
规划
用预训练视频扩散器当价值模型,联合预测未来本体状态与价值,突破VLM在长程任务中的时序建模瓶颈。
Jindi Lv, Hao Li, Jie Li, Yifei Nie, Fankun Kong, Yang Wang, Xiaofeng Wang,...
2026-04-10
RECAP
VLA
世界模型
价值函数
具身智能
双分支 flow matching 视频生成模型,联合建模视觉与 V-JEPA2 物理潜变量
Ying Shen, Jerry Xiong, Tianjiao Yu, Ismini Lourentzou
2026-04-10
Cross-Attention
Flow Matching
世界模型
物理一致性
视频生成
实时单视频驱动的 4D 交互世界模型,24FPS 跑出 SOTA 相机控制。
InSpatio Team, Donghui Shen, Guofeng Zhang, Haomin Liu, Haoyu Ji, Hujun Bao,...
2026-04-09
世界模型
实时推理
扩散模型
新视角合成
自回归
把神经网络本身当作一台计算机,用视频模型承载传统计算机的计算、内存和 I/O。
Mingchen Zhuge, Changsheng Zhao, Haozhe Liu, Zijian Zhou, Shuming Liu, Wenyi...
2026-04-09
GUI/CLI 模拟
世界模型
可学习运行时
扩散 Transformer
神经计算机
单令牌编码帧间差分,35×参数、2000×FLOPs缩减的生成式世界模型。
Tommie Kerssies, Gabriele Berton, Ju He, Qihang Yu, Wufei Ma, Daan de Geus,...
2026-04-09
世界模型
生成式模型
自动驾驶
自监督学习
视觉基础模型