用 3D 轨迹作为视频到机器人动作的可复用中间表征,纯视频预训练即可匹敌有动作监督的 VLA。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个同时满足高保真、长时一致性和高效生成的机器人操作世界模型
系统梳理LLM智能体环境的生命周期,涵盖环境建模、自动合成、质量评估及智能体-环境协同演化
通过场景演化先验和轨迹运动先验提升VLA模型的OOD泛化能力
世界模型自蒸馏:训练世界模型解决通用任务
👍 15通过自蒸馏和VLM反馈将视频扩散模型转为指令跟随的任务求解器
提出使用单个LLM同时扮演Agent和环境两个角色,实现自举式协同进化,在多任务基准中平均提升超过4%
首个统一评估视频世界模型物理、几何、交互能力的综合基准测试
系统综述文本世界模型的构建方法、训练与推理应用及评估挑战
多块预测框架解决自回归视频世界模型训练中的短视监督问题
视频世界模型的潜在空间记忆
👍 71在潜在空间直接构建3D记忆,实现高效几何一致的视频生成
通过固定backbone对照研究视频世界模型中四种记忆机制
将视频世界模型从相机导航扩展到对象级轨迹控制,实现相机与对象操作的组合控制
解耦世界规划与动作执行,异步双系统机器人策略提升闭环控制效率
通用机器人智能的核心瓶颈是缺乏将物理世界经验转化为机器人可用监督信号的机制,需要构建四大支柱组件。
提出首个评估视频生成模型物理可执行性的基准测试框架,通过模拟器中的实际执行成功来衡量模型的物理知识。
通过模态感知的一致性蒸馏,将世界动作模型的推理延迟从8.1秒降至348毫秒,实现23倍加速
提出统一的离散标记空间,将视觉观测、动作和未来演化对齐,实现自动驾驶中的世界建模与策略生成联合优化
用一个 Mixture-of-Transformers 统一语言/图像/视频/音频/动作的理解与生成
让MLLM学会何时调用、验证、信任世界模型的视频推演来预测未来。
基于Cosmos的实时生成式世界模型,用于自动驾驶闭环仿真与策略训练