把长期情景记忆编译成语言-视觉计划,用固定上下文执行长时程记忆依赖操作
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用紧凑的语义动作接口,让基础 VLM 零样本或数 GPU 小时微调即可直接操控机器人
开源模块化研究栈把世界-动作模型预训练变成受控实验,提炼三大准则并开源6400小时数据预训练模型
从零预训练的世界-动作模型,零样本OOD成功率随数据从300小时到3万小时由17.1%升至44.1%
用手持夹爪采集手-爪配对数据,两阶段扩散框架实现复杂空间操作迁移
280个难度分级任务系统诊断VLA模型:复杂空间与长程操作下最强模型成功率也跌至22.3%
以可执行技能契约和守卫运行时把VLA策略变成闭环具身智能体
不设专用记忆模块,把分钟级时间戳视频直接作为VLM原生上下文,四项记忆基准全部刷新SOTA
用冻结教师VLM把已执行行为的语义目标蒸馏进VLA动作解码器,大幅提升操作成功率与泛化
复用预训练MLLM原生上下文作机器人记忆,以异步连续认知令牌驱动VLA控制器
以人类视频为上下文提示,让机器人零样本完成训练中从未见过的操作任务
让VLA逐块流式生成动作并实时注入触觉反馈,消除执行中的触觉时间错配
指令锚定的流式时序建模让单帧VLA获得时序记忆,零新增参数全面超越π0.5
三系统架构+3.7万小时异构数据一阶段预训练,协同理解、预测与行动的具身基础模型。
把未来想象压缩为潜在动作意图序列,性能追平 Joint-WAM 且延迟降低 42.9%
免训练质量/刚度估计加双智能体探索,让机器人主动摸出隐藏物理属性。
用VLM编排VLA探索采集新任务数据,再经蒸馏与残差RL高效微调
只用夹爪几何训练CVAE学习接触分布,推理时才见物体,零样本生成灵巧抓取
冻结VLA策略,用自进化的代码Critic与恢复技能实现机器人闭环执行治理与持续提升
可解码不等于可排序:动作条件辅助监督让潜在代价排序对齐真实结果,提升MPC成功率