4千条视触觉演示加DSR指标,识别任务成功却过度挤压物体的策略
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
SE(3) 几何感知的动作条件视频世界模型,登顶 WorldArena 2.0 预测赛道
用4D持久世界记忆+自我工作记忆,让VLA仅凭腕部相机打赢多视角基线的长时程操作
任务条件化的腕部未来潜在预测,让VLA获得细粒度操作能力
将黏性污渍清洁重定义为拓扑聚合问题,用扩散策略生成分段推动实现零样本泛化
用DINOv3语义表示从未来预测和历史检索双向增强WAM的操作鲁棒性。
统一世界预测与价值估计的VLA强化学习评论家模型,149任务达SOTA
0.9B小模型自引导预测未来状态并注入几何监督,登顶LIBERO与LIBERO-Plus
首个大规模触觉预训练VTLA模型,把触觉当作预测目标并配ALTER离线强化学习。
首个大规模触觉原生世界-动作模型,联合预测视觉、触觉与动作
在VLA预测失败时用RL策略组合式引导动作流,OOD任务成功率最高提升17.3%
摒弃LLM中转,用轻量编码器与双向跨注意力直接预测动作,实现32Hz实时控制
πR²:反应式实时流匹配策略
👍 4让大规模VLA流匹配策略实时闭环,重规划提速约4倍,成功率提升最高30%
用高保真手持采集替代遥操作,实现零机器人数据的策略训练与直接部署
用代码归纳世界动力学,可仿真、可规划、可解释。
具身操作的数据金字塔
👍 36用五层数据金字塔系统化组织具身智能数据生态
真实图像自动重建十万个物理一致的桌面仿真场景与抓取轨迹
用锚定与对齐两个损失,让VLA微调在零额外数据下同时保住语义理解与动作精度
三尺度具身基础模型,新增3D接地与接触点预测,统一动作空间跨本体VLA。
用十万小时UMI真实轨迹预训练的VLA基础模型,刷新四大机器人基准SOTA