把长期情景记忆编译成语言-视觉计划,用固定上下文执行长时程记忆依赖操作
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用视觉校准片段教会动作条件世界模型零样本适应未见环境
以表征为中心的持续预训练,用开源数据加16卡算力训出可迁移的VLA骨干
把指令拆成原子动作分给各臂,用臂洗牌训练实现未见协作模式的组合泛化
以夹爪为中心学习接触流形,按人类抓取拓扑零样本合成灵巧抓取
冻结模型参数,通过进化技能与上下文支架免训练适配具身智能体
用时间戳免费导出的时间距离取代偏好与进度标注,训练出可作稠密奖励的机器人价值基础模型。
用约200美元的开源头戴设备,规模化采集带同步IMU的双目自我中心视频
以「权重 vs 技能」为轴,梳理 77 个机器人学习系统的自我改进谱系
把第一人称人手操作视频转成1.86万小时机器人训练数据,提升VLA跨分布泛化。
机器人学习中的进度奖励建模:一份全面综述
👍 192统一框架梳理机器人学习进度奖励模型:接口、构造机制、数据与评测
统一扩散Transformer融合动作生成与未来视觉预测,无需大型VLM即可达LIBERO前沿
提出包含42个模拟任务和18个现实世界任务的统一基准,评估通用机器人操作策略在泛化、记忆、长期执行、精度和开放语义五个维度的能力。
通过两阶段真实世界RL,将触觉反馈残差适应到预训练视觉策略,大幅提升接触丰富操作任务的成功率
融合LLM规划器和VLM批评者,将视频生成器转化为任务感知的世界模型,显著提升长周期机器人操作性能
用生成式世界模型替代真实机器人,实现实时数字遥操作数据生成
系统研究世界模型作为机器人策略评估器的关键设计要素,提出GigaWorld-1实现14.9%性能提升
用任务无关预训练解锁物理常识,减少VLA对专家数据的依赖
持续学习系统,自动编写机器人程序并积累可重用技能库
通过三层对齐机制解决移动操作中时序粒度、动作空间和训练推理一致性的结构化不匹配问题