提出GPS表示结合VR数据收集,提升机器人对关节部件的感知与操作能力
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
统一的8B参数具身基础模型,整合认知、规划和定位能力,实现SOTA性能
通过场景演化先验和轨迹运动先验提升VLA模型的OOD泛化能力
提出语义视觉-动作令牌化器,构建统一语义空间用于世界动作建模
解耦世界规划与动作执行,异步双系统机器人策略提升闭环控制效率
从语言和视频证据直接生成LoRA适配器,实现零样本机器人策略适应
提出首个评估视频生成模型物理可执行性的基准测试框架,通过模拟器中的实际执行成功来衡量模型的物理知识。
通过结构化功能可供性预测作为中间表示,解决VLA模型语义空间与物理控制空间不匹配问题。
用语义事件而非固定时间块作为学习单元,解决语言-视觉-动作粒度失配问题
AFUN 单次前向联合预测功能性掩码与3D贝塞尔运动曲线,迈向开放世界机器人操作。
把多选题改造成机器人抓取任务,诊断VLA是否真懂指令语义。
利用图像转换、语言和3D流的三模态对齐学习动力学感知的机器人视觉表示
生成式监督助力具身智能
👍 32将深度图生成融入VLM预训练,提升空间推理与物理操作能力
用VGGT编码最近16帧历史,注入VLA以解决块间意图冲突。
将VLA训练中的帧采样重新定位为时序监督再分配问题
VLM规划器与VGM模拟器在双相循环中互训,从无标注种子图自演化机器人操作。
用视觉隐空间世界模型给VLA加上前瞻规划,实现工业机械臂零人工干预
把VLM做高层规划、DiT做低层控制,用级联交叉注意力桥接视觉定位与动作。
提出原生离散扩散VLA模型,统一多模态理解与生成,实现机器人长视距精准控制
用视觉提示解耦高层推理与低层控制,提升机器人操作精度