在 on-policy RL 中复用 rollout 的下一观测做辅助世界模型监督,零额外推理开销
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出解耦记忆架构实现分钟级一致长视频生成
全栈框架将视频基础模型转为实时相机可控世界模型
YoCausal评估视频扩散模型的因果理解,发现时间箭头感知不等同于因果认知
提出Simplex旋转编码和稀疏Hub注意力,实现可扩展至四个玩家的多智能体世界模型
首个闭环视频世界模拟器,支持状态预测和奖励评估
用干预式基准诊断视频生成模型是否真正理解物理规律。
把终端输出 token 当作监督信号,叠加到 GRPO 损失上,让失败轨迹也产生梯度。
SCOPE 用按像素时序条件化把 FPS 动作的局部分析与全局稳定解耦
无需训练,靠KV缓存的视角检索与相似度压缩,让视频世界模型拥有长程一致记忆
通过自调节模拟规划实现高效智能体推理
👍 11自调节模拟规划让30B智能体以更少token匹敌1T模型
WorldString:统一表征铰接/蒙皮/软体三类可动作对象的隐式神经占据场。
用 LLM 先验从纯观测轨迹中归纳可执行 POMDP,摆脱对真实隐藏状态的依赖。
2.6B参数高效分钟级720p相机控制世界模型,单卡可部署
DAWN:世界-动作交互模型的开端
👍 27提出WAIM范式与DAWN模型,让世界预测与轨迹生成在隐空间中递归互炼。
世界动作模型:具身智能的下一前沿
👍 69首篇系统综述将世界模型融入动作生成的具身基础模型范式,提出 Cascaded/Joint WAM 二分法。
可读规则下运行时发现优于离线世界模型
机器人学习中的世界模型:一份综合性综述
👍 17系统梳理世界模型在机器人策略学习、模拟器、视频生成与导航驾驶中的架构范式、功能角色与评测体系。
把视频生成评测重定义为世界状态预测,提供436个结构化推理用例与6K专家偏好对的诊断式基准。
提出残差潜在动作RLA,在紧凑潜在空间中流匹配预测DINO特征动力学