把机器人执行视频转成进度曲线,用 OPD 指标体系细粒度评估具身模型的过程能力
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
冻结模型参数,通过进化技能与上下文支架免训练适配具身智能体
602段360°视频重建秋叶原,175个人工任务暴露LMM城市导航远逊人类
用约200美元的开源头戴设备,规模化采集带同步IMU的双目自我中心视频
用执行中心的能力分类法训练四类专家再合并蒸馏成统一具身VLM
视频全局空间感知基准,揭示最强VLM仍落后人类36分,定向训练可大幅缩小差距。
把第一人称人手操作视频转成1.86万小时机器人训练数据,提升VLA跨分布泛化。
仅用一张RGB图与指令,从冻结视频扩散中间特征直接读出6-DoF物体轨迹。
把真实家庭改造成同步多模态录制棚,构建具身AI的长时程人-物交互数据引擎
三阶段框架让VLM先调用专业视觉工具,再把工具能力内化为无工具推理。
冻结 VLM 通过原子技能控制人形身体,瓶颈不在感知而在具身自意识。
用高保真手持采集替代遥操作,实现零机器人数据的策略训练与直接部署
具身操作的数据金字塔
👍 36用五层数据金字塔系统化组织具身智能数据生态
首个评测 VLM 智能体在多物体 3D 场景上执行动作的可执行基准
三尺度具身基础模型,新增3D接地与接触点预测,统一动作空间跨本体VLA。
开源2000小时手机采集的第一人称操作数据集及端到端工具链
用十万小时UMI真实轨迹预训练的VLA基础模型,刷新四大机器人基准SOTA
提出世界-动作漂移攻击,让机器人想象正常却执行失败动作
统一语言推理与视觉想象,单模型端到端生成具身规划
用混合专家架构把世界动作模型推理延迟降到85毫秒。