通过动作条件预训练世界模型,获得可复用的机器人动力学先验
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过分层物理对齐提升机器人视频生成的物理合理性,用于世界模拟和策略学习
通过手腕平移桥接动作实现人类操作技能向双手机器人有效转移
从单视频自动构建数字孪生及其多样性变体,实现机器人策略的仿真评估与训练
通过以对象为中心的残差RL,在仿真中训练的策略零样本提升真实VLA机器人成功率从42%到76%
机器人控制的上下文世界建模
👍 63通过自探测交互上下文实现机器人策略零样本适应新配置
用于机器人操作的世界价值模型
👍 7将世界模型作为机器人价值学习的基础,实现SOTA任务进度估计
让VLA模型在原始动作层面可操控,实现零人类演示的自主机器人技能获取
提出极坐标结构的潜在动作表示,用半径编码过渡范围,方向编码模式
玩趣型智能体机器人学习
👍 50让机器人通过自我导向的玩耍学习可重用代码技能,无需显式任务指令
用图像编辑替代视频生成作为世界动作模型骨干,降低推理成本并提升机器人控制性能
提出ENPIRE框架让编码代理在真实世界中自主构建环境接口并改进机器人策略,实现99%任务成功率
实验证明自我视角视频预训练在泛化能力上超越机器人数据预训练
提出统一动作表示和可靠性感知训练,融合人类视频与机器人数据预训练VLA模型
用潜在视觉子目标替代像素级未来预测,实现低延迟机器人控制
腾讯 Robotics X 提出端到端 VLA 栈:10K小时UMI数据+4B MoT VLM+FlowPRO离线RL,跨形态零遥操作部署。
通过两阶段预训练动作专家解决VLA模型OOD语言泛化问题
用第一人称视频的相机运动作为主动感知监督信号预训练机器人策略
通过RoboGenesis模拟数据引擎和两阶段训练方法,实现实验室自动化VLA模型
世界模型自蒸馏:训练世界模型解决通用任务
👍 15通过自蒸馏和VLM反馈将视频扩散模型转为指令跟随的任务求解器