将触觉感知融入预测式视频世界模型,实现接触丰富操作的鲁棒控制
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出14B参数物理对齐世界模型,生成符合物理定律的机器人操作视频
通过VL-MoT框架和动作引导的视觉剪枝策略,解决VLA模型深层视觉敏感性衰减问题
用动作后果识别后验为离线机器人数据分配保守权重,无需奖励信号
用强化学习将视频MLLM转变为主动评论者,实现机器人任务进度精确估计和零样本故障检测
面向动态环境的可泛化机器人操作
👍 3提出DOMINO数据集和PUMA架构解决机器人动态操作问题
SDF 非完整水弹性模型高保真模拟触觉剪切,实现零样本 sim-to-real 触觉 RL 迁移。
提出自演化门控注意力模块 SEGA,将扩散策略的有效时序视野扩展到分钟级长程任务,仅需 33M 参数即可超越 1.2B 参数的 RDT。
大规模机器人操作基准测试,系统评估记忆增强型策略
首个大规模系统实证研究:delta 动作配关节空间是标准模仿学习的最优解,任务空间则在跨本体迁移中胜出
将未来观测压缩到条件空间,引导VLA模型精准生成动作
通过500+消融实验系统探索VLA设计空间,提炼12条关键发现和一个实用配方,构建出SOTA级VLA模型
仅0.5B参数的VLA基线通过标准化训练细节实现SOTA,超越数十亿参数大模型。
模块化人形机器人开放词汇物体抓取系统,末端跟踪误差降低5.5倍
整合600万+轨迹构建统一流形学习VLA模型,实现跨具身通用机器人操作
RL+仿真交互+真实SFT锚定,提升VLA模型真实部署成功率
层次化VLA架构实现零样本机器人操作,无需真实数据即可生成高质量训练数据
用20小时数据和8个A100 GPU,通过解决三个分布不一致性问题,将机器人操作成功率提升250%
统一VLA框架交错语言规划、视觉预测与动作生成
通过动力学增强的潜在动力学模型,从无标签视频学习可迁移任务知识