DynamicVLA通过连续推理和潜在感知动作流实现动态物体实时操作,并构建DOM基准测试。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
两阶段训练的轻量物体中心模块,提升机器人操作的视觉鲁棒性
通过知识蒸馏将VLA模型从18层压缩到6层,实现2倍推理加速且精度损失<1%
一个务实的视觉-语言-动作基础模型
👍 50基于2万小时真实双臂机器人数据训练的VLA基础模型,实现跨平台泛化与高效训练
从视觉编码器提取亲和力提示注入语言模型,免训练提升VLA模型的空间理解能力
通过贝叶斯分解和潜在动作查询,强制VLA模型真正遵循语言指令而非依赖视觉捷径
具身AI基座模型,通过3D空间推理和密集时序估计实现精准操作
CLARE通过轻量级适配器和自编码器路由实现机器人VLA模型的持续学习,避免灾难性遗忘
通过压缩链式推理到紧凑的连续潜在表示,实现视觉-语言-动作任务的高效推理
首个引入时空记忆机制的相机控制视频重渲染框架,实现多视图场景的一致性生成
提出CHORD方法,通过蒸馏视频生成模型生成多物体交互的4D场景运动
SOP通过分布式机器人在线经验共享实现VLA模型的高效多任务后训练
提出3D物体流作为通用中间接口,将视频生成模型的视觉预测转化为机器人可执行动作,实现零样本开放世界操作