提出多层次评估框架,揭示MLLMs在双手协调中「高级推理强、精细执行弱」的协调悖论
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
整合600万+轨迹构建统一流形学习VLA模型,实现跨具身通用机器人操作
世界模型条件化强化学习,复杂操控任务成功率提升约30%。
首次将视频生成模型引入VLN,通过稀疏生成实现超越视野导航
统一五大导航任务的VLA基础模型,1690万轨迹+7802场景,7项基准SOTA
提出一个专为物理AI设计的多模态批评模型,通过自我参照的批评微调来提升物理推理和评估能力。
基于代理的框架将文本描述转化为模拟就绪的3D环境,支持机器人策略学习
将机器人与GPU统一抽象,支持异构多机器人在线策略学习的系统框架
评估基础模型在部分可观环境中通过主动探索构建、修正和利用空间信念的能力
用两个协作智能体自动构建平衡评测基准并生成可执行评测流程,压缩85%冗余样本、降低77%评测成本
批判碎片化的任务知识注入范式,提出统一世界模型框架的五大核心组件
双脑架构冻结左脑保通用、训练右脑做控制,用 AsyMoT 机制融合语义与动作
重新思考面向具身世界的视频生成模型
👍 46提出机器人视频生成基准RBench与大规模数据集RoVid-X
具身AI基座模型,通过3D空间推理和密集时序估计实现精准操作
通过隐式多模态思维链推理实现视觉语言导航,训练时用思维链、推理时无需显式生成,兼顾推理能力与实时性
通过知识经验学习对齐智能体世界模型
👍 15WorldMind框架通过过程经验和目标经验,在推理时自主对齐LLM智能体的内部世界模型
CoV:用于空间推理的视点链提示
👍 11训练无关的测试时框架,通过粗到细视点探索提升3D具身问答性能
演化式程序化技能网络
👍 88提出PSN框架,让智能体通过可执行符号程序持续获取、精炼和重用技能