快慢双系统VLN基础模型,统一五大导航任务并刷新城市级导航SOTA
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
机器人智能体操作系统,融合分层推理、源接地图记忆与失败驱动的终身自演化
38B统一具身合成模型,兼做世界模型与机器人数据引擎
首个开源MoE视频基础模型,通过稀疏专家架构、机器人增强数据和多维奖励系统实现物理世界的精确模拟。
首个真实世界城市规模多模态数据集,支持街景重建和具身智能研究
通过参数隔离将触觉能力注入小型MLLM,在避免灾难性遗忘的同时实现SOTA触觉推理
通过前瞻令牌从冻结视频模型中蒸馏动力学先验的统一机器人操作框架
通过SVA框架将MCTS搜索蒸馏为轻量级评估器,实现冻结VLA模型的测试时间缩放
用40M潜空间监视器检测动作漂移并在线纠错,让VLA动作时域自适应化。
通过三层对齐机制解决移动操作中时序粒度、动作空间和训练推理一致性的结构化不匹配问题
虎鲸:世界在您心中
👍 312统一世界基础模型,从多模态信号学习世界潜在空间
通过分层物理对齐提升机器人视频生成的物理合理性,用于世界模拟和策略学习
Vesta:通才型具身推理模型
👍 10统一定位、导航、推理和规划的通用具身模型,超越各领域专家模型
提出评测长期有状态具身智能体的基准和观察者锚定记忆框架
实验证明自我视角视频预训练在泛化能力上超越机器人数据预训练
用 2K 仿真轨迹蒸馏到 4B 模型,实现前沿级操作性能
以自然语言为统一动作接口,跨场景训练具身视频世界模型。
腾讯 Robotics X 提出端到端 VLA 栈:10K小时UMI数据+4B MoT VLM+FlowPRO离线RL,跨形态零遥操作部署。
iMaC把未来动作渲染成运动图与接触图,注入视频扩散模型做策略评估。
统一的8B参数具身基础模型,整合认知、规划和定位能力,实现SOTA性能