把7自由度机器人动作编码成像素级动作图像,让视频主干直接当零样本策略
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过多尺度频域标记化显式解耦行为意图与执行细节,提升机器人操作泛化与迁移能力
通过全局到局部重构学习编码what-is-where场景组成的紧凑视觉状态
通过Horizon-Aware Schedule将流式VLA即时动作采样加速10倍
将RL作为分布收缩算子,在预训练生成式策略基础上实现稳定高效的长周期机器人操作技能微调。
通过170万条仿真轨迹实现零样本sim2real迁移,在真实机器人上达到79.2%成功率
无批评器、无似然的步级对比排序框架,解决流式VLA的在线RL难题
用智能手机AR可视化策略意图,实现无机器人即时策略迭代,数据效率提升2倍
首个真实世界从零起步的逆向强化学习,仅需观察与交互即可学视觉操控
通过仿真回放一致性过滤合成机器人数据,大幅提升策略学习效果
通过教师-学生蒸馏框架,让移动机器人仅凭自我视角完成多物体长期推放任务
通过两阶段微调和多视觉基础模型并行对齐,为VLA模型注入隐式世界建模能力
通过组合式世界模型在想象空间中进行强化学习,实现机器人策略的自我改进
通过无信息泄漏的 JEPA 风格预训练学习动作相关的状态转移语义
通过自不确定性同时调制视觉注意力和动作采样,提升VLA模型的测试时鲁棒性
基于代理的框架将文本描述转化为模拟就绪的3D环境,支持机器人策略学习
RD-VLA通过潜空间循环迭代推理实现机器人控制的自适应计算缩放
将机器人与GPU统一抽象,支持异构多机器人在线策略学习的系统框架
用44k小时人类视频预训练机器人世界模型,实现零样本泛化
提出训练无关的推理时引导框架,利用VLM生成可微奖励函数来引导冻结的机器人扩散策略适应分布外场景。