CoWVLA 通过结构-运动解耦的潜在表示统一世界模型与潜在动作,实现高效机器人操控
Fuxiang Yang, Donglin Di, Lulu Tang, Xuancheng Zhang, Lei Fan, Hao Li, Chen...
2026-03-04
VLA模型
世界模型
具身智能
机器人操控
潜在动作
利用全局几何记忆和立体记忆两种机制,从单张图片生成多轨迹一致视频并重建高质量3D场景
Yisu Zhang, Chenjie Cao, Tengfei Wang, Xuhui Zuo, Junta Wu, Jianke Zhu, Chunchao Guo
2026-03-03
3D重建
世界模型
扩散模型
相机控制
视频生成
首次提出“微观世界仿真”概念,构建专家审核的显微视频基准、9.6K 数据集与微调模型。
Rongsheng Wang, Minghao Wu, Hongru Zhou, Zhihan Yu, Zhenyang Cai, Junying...
2026-03-03
世界模型
基准评测
扩散模型微调
数据工程
生物医学仿真
首个真实世界从零起步的逆向强化学习,仅需观察与交互即可学视觉操控
Tyler Han, Siyang Shen, Rohan Baijal, Harine Ravichandiran, Bat Nemekhbold,...
2026-03-03
世界模型
机器人学习
模仿学习
模型预测控制
视觉操控
提出模态/空间/时间三维一致性框架及CoW-Bench基准,系统评估世界模型的物理模拟能力
Jingxuan Wei, Siyuan Li, Yuhang Xu, Zheng Sun, Junjie Jiang, Hexuan Jin,...
2026-02-27
一致性评估
世界模型
基准测试
多模态学习
视频生成
通过双曲JEPA和几何强化学习,提升能量预测世界模型的长程规划能力
Zeyu Zhang, Danning Li, Ian Reid, Richard Hartley
2026-02-27
JEPA
世界模型
双曲几何
强化学习
视觉规划
零专家依赖,通过风险感知世界模型实现可泛化的端到端自动驾驶
Jiangxin Sun, Feng Xue, Teng Long, Chang Liu, Jian-Fang Hu, Wei-Shi Zheng, Nicu Sebe
2026-02-27
世界模型
无监督学习
自动驾驶
预测控制
首个多人 Minecraft 视频世界模型,支持多视角一致性生成
Georgy Savva, Oscar Michel, Daohan Lu, Suppakit Waiwitlikhit, Timothy...
2026-02-26
Minecraft
世界模型
多智能体
扩散模型
视频生成
将未来观测压缩到条件空间,引导VLA模型精准生成动作
Yue Su, Sijin Chen, Haixin Shi, Mingyu Liu, Zhengshen Zhang, Ningyuan Huang,...
2026-02-26
世界模型
机器人操作
条件生成
模仿学习
视觉-语言-动作模型
用协同演化世界模型替代进化启发式,引导LLM进行GPU内核优化搜索
Shiyi Cao, Ziming Mao, Joseph E. Gonzalez, Ion Stoica
2026-02-24
CUDA
GPU内核优化
世界模型
代码生成
大语言模型
提出混合2D-3D手部条件化策略,实现精细手部交互的沉浸式VR视频生成
Linxi Xie, Lisong C. Sun, Ashley Neall, Tong Wu, Shengqu Cai, Gordon Wetzstein
2026-02-23
世界模型
人机交互
手部姿态估计
扩散模型
虚拟现实
提出首个桌面软件世界模型CUWM,通过文本+视觉两阶段分解预测UI状态转换,提升智能体决策质量
Yiming Guan, Rui Yu, John Zhang, Lu Wang, Chaoyun Zhang, Liqun Li, Bo Qiao,...
2026-02-20
GUI智能体
世界模型
强化学习
桌面软件
测试时规划
首个星际争霸II世界模型,通过预测未来观测实现LLM决策的前瞻性优化
Yixin Zhang, Ziyi Wang, Yiming Rong, Haoxi Wang, Jinling Jiang, Shuang Xu,...
2026-02-20
世界模型
决策优化
大语言模型
星际争霸II
部分可观测
通过两阶段微调和多视觉基础模型并行对齐,为VLA模型注入隐式世界建模能力
Han Zhao, Jingbo Wang, Wenxuan Song, Shuai Chen, Yang Liu, Yan Wang, Haoang...
2026-02-20
世界模型
扩散策略
机器人学习
模仿学习
视觉语言动作模型
14B视频扩散模型联合预测视频与动作,实现机器人零样本泛化与跨具身迁移
Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George...
2026-02-19
世界模型
机器人基础模型
视频扩散模型
跨具身迁移
零样本泛化
将JEPA从图像块扩展到对象级表示,通过遮蔽诱导因果归纳偏置,实现高效交互感知的世界建模
Heejeong Nam, Quentin Le Lidec, Lucas Maes, Yann LeCun, Randall Balestriero
2026-02-18
世界模型
因果推理
对象表示
模型预测控制
自监督学习
提出ViewRope几何感知位置编码,解决视频世界模型在相机循环闭合时的空间不一致问题
Chendong Xiang, Jiajun Liu, Jintao Zhang, Xiao Yang, Zhengwei Fang, Shizun...
2026-02-18
3D一致性
世界模型
位置编码
注意力机制
视频生成
基于1M+真实轨迹训练的开放网页世界模型,显著提升智能体性能
Zikai Xiao, Jianhong Tu, Chuhang Zou, Yuxin Zuo, Zhi Li, Peng Wang, Bowen...
2026-02-17
世界模型
大语言模型
强化学习
数据合成
网页智能体
用局部点云记忆替代全局3D重建,实现长时域相机可控视频生成的世界一致性
Zun Wang, Han Lin, Jaehong Yoon, Jaemin Cho, Yue Zhang, Mohit Bansal
2026-02-17
3D重建
世界模型
相机控制
视频生成
记忆增强
世界模型条件化强化学习,复杂操控任务成功率提升约30%。
GigaBrain Team, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Hao Li,...
2026-02-13
世界模型
具身智能
强化学习
机器人操控
视觉-语言-动作模型