通过组合式世界模型在想象空间中进行强化学习,实现机器人策略的自我改进
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出INTENT框架,通过意图感知世界模型在推理时实现预算受限的工具使用规划
通过无信息泄漏的 JEPA 风格预训练学习动作相关的状态转移语义
通过动力学增强的潜在动力学模型,从无标签视频学习可迁移任务知识
首个开放域闭环世界模型基准,评测记忆一致性与动作控制
用RL后训练大幅提升视频世界模型的动作跟随精度和视觉质量
通过RL训练的策略模型自适应决定何时及如何使用世界模型进行视觉空间推理
LIFT框架:SAC大规模预训练+物理信息世界模型,实现人形机器人安全高效微调
用44k小时人类视频预训练机器人世界模型,实现零样本泛化
基于潜在动作的自改进世界建模
👍 32将动作视为潜在变量,通过前向-逆向模型交替优化实现无标注世界建模
面向 LLM 智能体的强化世界模型学习
👍 28用自监督 RL 训练 LLM 成为动作条件的世界模型,提升智能体决策能力
提出分层无姿态记忆压缩器,实现1000帧连续世界模拟
批判碎片化的任务知识注入范式,提出统一世界模型框架的五大核心组件
LIVE:长时域交互式视频世界建模
👍 13通过循环一致性目标约束误差累积,实现稳定长时域视频生成
通过生成可渲染Web代码而非直接像素来建模移动GUI状态转换
通过时序KV压缩和ANN稀疏注意力实现5-10倍加速的自回归视频生成
世界模型量化的实证研究
👍 5系统评估 PTQ 对视觉规划世界模型的影响,揭示五条关键量化洞察
面向机器人控制的因果世界建模
👍 32提出LingBot-VA自回归扩散框架,统一视频动态预测与动作推理实现闭环机器人操控
提出概念解耦的视频基准,定量评估世界模型对物理常数和直觉物理的理解
推进开源世界模型
👍 135开源世界模型LingBot-World,支持分钟级实时交互世界模拟