首个统一评估多模态智能体在异构3D环境中交互式空间推理能力的基准
Hongcheng Gao, Hailong Qu, Jingyi Tang, Jiahao Wang, Zihao Huang, Hengkang...
2026-06-09
3D环境
具身智能
基准测试
多模态智能体
空间推理
解耦世界规划与动作执行,异步双系统机器人策略提升闭环控制效率
Jisong Cai, Long Ling, Shiwei Chu, Zhongshan Liu, Jiayue Kang, Zhixuan...
2026-06-09
世界模型
具身智能
异步推理
机器人学习
机器人操作
通用机器人智能的核心瓶颈是缺乏将物理世界经验转化为机器人可用监督信号的机制,需要构建四大支柱组件。
Elis Karcini, Faisal Mehrban, Quang Nguyen, Mac Schwager, Arash Ajoudani,...
2026-06-08
世界模型
具身智能
多模态学习
强化学习
机器人学习
提出WLA模型统一世界建模、语言推理和机器人控制,实现高效长时程任务执行
Yi Yang, Zhihong Liu, Siqi Kou, Yiyang Chen, Yanzhe Hu, Jianbo Zhou, Boyuan...
2026-06-05
世界建模
具身智能
多模态模型
机器人学习
用一个 Mixture-of-Transformers 统一语言/图像/视频/音频/动作的理解与生成
Aditi, Niket Agarwal, Arslan Ali, Jon Allen, Martin Antolini, Adeline...
2026-06-04
Mixture-of-Transformers
Physical AI
世界模型
全模态
具身智能
首个全人工标注的流式空间智能基准,揭示多模态大模型在自我中心视频流上的空间推理巨大缺口。
Yifei Li, Pengyiang Liu, Yuhang Zang, Zhongyue Shi, Qi Fu, Hongye Hao, Jiwen Lu
2026-06-04
CoT思维链
具身智能
基准测试
多模态大模型
流式空间智能
提出TVR任务和TVRBench基准,发现基础模型难以通过主动探索重现目标视角,后训练提升至51.4%
Liyang Li, Muzhi Zhu, Zhiyue Zhao, Hengyu Zhao, Ke Liu, Linhao Zhong, Hao...
2026-06-02
主动视觉
具身智能
多模态学习
强化学习
空间推理
从图像生成的物理因素出发,评测具身场景下VLM在材质/视角/光照/几何四类视觉应力下的鲁棒性。
Leyi Wu, Yifan Zhao, Jinjie Zhang, Suzeyu Chen, Wosong Chen, Zhifei Chen,...
2026-06-02
具身智能
视觉定位
视觉语言模型
视觉问答
逆向图形学
把多选题改造成机器人抓取任务,诊断VLA是否真懂指令语义。
Bin Yu, Yao Zhang, Haishan Liu, Shijie Lian, Yuliang Wei, Xiaopeng Lin,...
2026-06-02
VLA模型
具身智能
基准测试
机器人操作
模仿学习
统一多任务多机器人的视觉-语言-行动模型,通过DiT解码器和具身感知prompt实现泛化。
Qiuyue Wang, Mingsheng Li, Jian Guan, Jinhui Ye, Sicheng Xie, Yitao Liu,...
2026-05-29
具身智能
多任务学习
导航
机器人操控
视觉-语言-行动模型
将深度图生成融入VLM预训练,提升空间推理与物理操作能力
Ruowen Zhao, Bangguo Li, Zuyan Liu, Yinan Liang, Junliang Ye, Fangfu Liu,...
2026-05-28
VLA
具身智能
机器人操作
深度预测
视觉-语言模型
跨范式确定性空间基础模型评测基准,配套DA-Next-5M与DA-Next。
Haosong Peng, Hao Li, Jiaqi Chen, Yuhao Pan, Runmao Yao, Yalun Dai, Fushuo...
2026-05-27
3D视觉
具身智能
基准测试
多视角重建
数据集
基于VLM的模板化RLE几何表示,统一生成刚体/可变形/铰接仿真3D资产
Ziang Cao, Yinghao Liu, Haitian Li, Runmao Yao, Fangzhou Hong, Zhaoxi Chen,...
2026-05-22
3D生成
Run-Length Encoding
仿真就绪资产
具身智能
机器人策略学习
提出首个要求主动探索的空间智能基准,揭示行动选择比感知能力更重要
Yining Hong, Jiageng Liu, Han Yin, Manling Li, Leonidas Guibas, Li Fei-Fei,...
2026-05-20
主动感知
具身智能
基准测试
感知-行动回路
空间推理
用自进化的视觉热图替代文本记忆与教师 LLM,为 3B VLM 智能体注入密集空间奖励。
Pan Wang, Yihao Hu, Xiujin Liu, Jingchu Yang, Hang Wang, Zhihao Wen
2026-05-19
具身智能
奖励塑形
强化学习
技能记忆
视觉语言模型
在真实 ShadowHand 上构建德州扑克基准,联合评估灵巧操作、感知与闭环决策。
Feng Chen, Tianzhe Chu, Li Sun, Pei Zhou, Zhuxiu Xu, Shenghua Gao, Yuexiang...
2026-05-19
具身智能
基准测试
灵巧操作
视觉-语言-动作模型
闭环决策
把静态 3DGS 场景拆解成可编辑、可物理交互的对象化场景。
Jichen Hu, Jiawei Guo, Jiazhong Cen, Chen Yang, Sikuang Li, Wei Shen
2026-05-18
3D 世界生成
3D 高斯泼溅
具身智能
可交互场景
场景分解
VLM规划器与VGM模拟器在双相循环中互训,从无标注种子图自演化机器人操作。
Harold Haodong Chen, Sirui Chen, Yingjie Xu, Wenhang Ge, Ying-Cong Chen
2026-05-14
DPO
GRPO
具身智能
机器人操作
自演化学习
首篇系统综述将世界模型融入动作生成的具身基础模型范式,提出 Cascaded/Joint WAM 二分法。
Siyin Wang, Junhao Shi, Zhaoyang Fu, Xinzhe He, Feihong Liu, Chenchen Yang,...
2026-05-13
世界模型
具身智能
基础模型
机器人学习
综述
系统梳理世界模型在机器人策略学习、模拟器、视频生成与导航驾驶中的架构范式、功能角色与评测体系。
Bohan Hou, Gen Li, Jindou Jia, Tuo An, Xinying Guo, Sicong Leng, Haoran...
2026-05-13
世界模型
具身智能
机器人学习
策略学习
视觉-语言-动作模型