找到 138 条结果

用一个 Mixture-of-Transformers 统一语言/图像/视频/音频/动作的理解与生成

Aditi, Niket Agarwal, Arslan Ali, Jon Allen, Martin Antolini, Adeline... 2026-06-04
Mixture-of-Transformers Physical AI 世界模型 全模态 具身智能

将深度图生成融入VLM预训练,提升空间推理与物理操作能力

Ruowen Zhao, Bangguo Li, Zuyan Liu, Yinan Liang, Junliang Ye, Fangfu Liu,... 2026-05-28
VLA 具身智能 机器人操作 深度预测 视觉-语言模型

首篇系统综述将世界模型融入动作生成的具身基础模型范式,提出 Cascaded/Joint WAM 二分法。

Siyin Wang, Junhao Shi, Zhaoyang Fu, Xinzhe He, Feihong Liu, Chenchen Yang,... 2026-05-13
世界模型 具身智能 基础模型 机器人学习 综述

系统梳理世界模型在机器人策略学习、模拟器、视频生成与导航驾驶中的架构范式、功能角色与评测体系。

Bohan Hou, Gen Li, Jindou Jia, Tuo An, Xinying Guo, Sicong Leng, Haoran... 2026-05-13
世界模型 具身智能 机器人学习 策略学习 视觉-语言-动作模型