加希腊语容易,证明有效难:五类常用指标全部失灵,需以构造性对照与多种子复现重建可信结论。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用冻结教师VLM把已执行行为的语义目标蒸馏进VLA动作解码器,大幅提升操作成功率与泛化
用4D持久世界记忆+自我工作记忆,让VLA仅凭腕部相机打赢多视角基线的长时程操作
任务条件化的腕部未来潜在预测,让VLA获得细粒度操作能力
用未来预测学共享动力学先验,MoE动作头生成各本体原生动作,单一检查点跨三类机器人
以「权重 vs 技能」为轴,梳理 77 个机器人学习系统的自我改进谱系
把第一人称人手操作视频转成1.86万小时机器人训练数据,提升VLA跨分布泛化。
用统一时空记忆把3D VLA扩展为同时高效、可泛化且支持记忆推理的操作框架
首例测试时对抗补丁攻击流匹配VLA,仅攻击首步去噪即近乎100%攻破π0
统一世界预测与价值估计的VLA强化学习评论家模型,149任务达SOTA
0.9B小模型自引导预测未来状态并注入几何监督,登顶LIBERO与LIBERO-Plus
在VLA预测失败时用RL策略组合式引导动作流,OOD任务成功率最高提升17.3%
摒弃LLM中转,用轻量编码器与双向跨注意力直接预测动作,实现32Hz实时控制
πR²:反应式实时流匹配策略
👍 4让大规模VLA流匹配策略实时闭环,重规划提速约4倍,成功率提升最高30%
用高保真手持采集替代遥操作,实现零机器人数据的策略训练与直接部署
具身操作的数据金字塔
👍 36用五层数据金字塔系统化组织具身智能数据生态
将目标识别建模为索引候选框的单token选择,结合TVBI时序记忆实现单目具身跟踪
用锚定与对齐两个损失,让VLA微调在零额外数据下同时保住语义理解与动作精度
用十万小时UMI真实轨迹预训练的VLA基础模型,刷新四大机器人基准SOTA
引入双重潜在记忆机制解决VLA模型长视野任务的时间偏差问题