← 返回 2026-08-05

世界建模向何处去:面向持续进化智能体的交互式世界代理 Quo Vadis, World Modeling?

Yu Yang, Xuemeng Yang, Licheng Wen, Lingdong Kong, Xiaobin Hu, Dongyue Lu, Wei Chow, Xiyan Huang, Yuxiang Feng, Yue Liao, Jianbiao Mei, Daocheng Fu, Rong Wu, Pinlong Cai, Ran Yi, Ying Tai, Jiangning Zhang, Botian Shi, Yong Liu, Shuicheng Yan 📅 2026-08-03 👍 36 2026-08-10 18:30
世界代理 世界模型 强化学习 持续进化 智能体 模型预测 视角论文

把世界模型重构为面向智能体的信息转移代理,提出6类功能×3层赋能的设计空间。

前置知识

世界模型 (World Model)

经典世界模型是一个状态转移模型 $\hat{s}_{t+1}=\mathcal{WM}(s_t,a_t)$:给定当前状态 $s_t$ 与动作 $a_t$,预测下一物理状态。现代自监督变体可在学习的隐空间而非原始像素中预测,但其骨架始终是“状态进去、动作施加、未来出来”,被广泛用于机器人、基于模型的强化学习与视频预测。

本文全部论证都从“重新思考这个经典定义”出发,把它沿三轴推广为“世界代理”,不先掌握世界模型的原定义就无法理解后续的信息转移、交互步与智能体中心视角。

基于模型的强化学习 (MBRL) 与想象 rollout

MBRL 用世界模型充当“可微模拟器”,在“想象(imagination)”中生成 rollout 据此训练策略,从而大幅降低真实样本成本;代表框架有 Dyna、PETS、Dreamer。核心思想是“先在世界模型里试错,再去真实环境执行”。

论文的 L2 训练时优化与 L3 协同进化,本质是把 MBRL 的“想象学习”从动力学预测推广到奖励、验证、执行等更广的代理功能,并把代理输出转成 SFT/DPO/PPO/GRPO 目标。

智能体的经验记忆与技能库 (Agent memory & skill library)

现代 LLM/具身智能体常配外部记忆库(检索过往经验、失败案例、约束)与技能库(可复用的工具调用流程、子策略),通过检索增强规划让智能体“先回忆再行动”,并用反思机制把失败转成改进提示。

本文把记忆/经验代理与技能代理列为六类功能中的两类,必须先理解“记忆与技能如何增强智能体决策”,才能看懂 L1 推理引导层中“先回忆/先想象再行动”的机制。

奖励建模 / 验证器 / RLHF 对齐

奖励模型与偏好模型对轨迹打分形成奖励,验证器/批评模型判断正确性与可行性,LLM-as-Judge 用大模型充当裁判;它们是 RLHF、DPO、PPO/GRPO 等策略优化与对齐方法的核心信号来源。

论文把奖励/验证代理列为第六类功能,并在 L2 层明确把代理输出转成 SFT/DPO/PPO/GRPO 训练目标;不懂奖励建模与对齐就难以理解 L2 如何“改写智能体策略”。

研究动机

当前智能体大多依靠“静态监督”训练——专家轨迹、人类标注或监督微调语料,这类数据只能刻画已存在的模式,无法在智能体自行探索时给出回应,致使其能力被训练分布封顶。最直接的破局之道是让智能体直接与真实环境交互(Agent→动作→真实环境→反馈→改进),但表1归纳了真实环境作为唯一训练场的四类瓶颈:训练效率低且成本高(机器人试错有器件磨损与安全代价,Web/GUI/游戏智能体消耗大量计算与交互资源);操作不可回滚且危险(机器人可能碰撞损坏物体、自动驾驶可能撞行人、网页智能体可能错误提交/删除/发送信息);反馈缺乏前瞻性(真实反馈多是事后被动,仅揭示已执行动作的后果,难以做多步预测);难以并行(真实环境实例有限且难以像仿真那样批量复制)。换言之,真实世界“不可或缺却不适合规模化”,智能体急需一个“夹在自身与环境之间、可低成本试错的中间层”。

本文的目标是本文目标是把世界建模从“忠实预测下一物理状态”重构为“为持续进化智能体提供可操作信息增益的代理”。作者提出并形式化定义“面向智能体的世界代理”:$\hat{s}_{\ell+1}=\mathcal{WP}(s_\ell,u_\ell^\mathcal{F})$,其中 $\ell$ 为交互步(不限于物理时间)、$\mathcal{S}$ 为涵盖物理状态/观测/记忆/知识/执行结果/验证的广义信息状态空间、$\mathcal{F}$ 为代理功能(动力学预测/空间渲染/执行仿真/记忆检索/技能引导/奖励验证)、$u_\ell^\mathcal{F}$ 为智能体主动发起的查询或干预。代理须同时满足三条要件:面向智能体的闭环、真实环境接地、可操作信息增益。最终作者用 6 类功能 × 3 层赋能的设计空间、五大有效性准则与四类开放挑战,为该范式建立路线图。

与已有工作不同的是,本文的独特切入点是把视角从“世界模型自身有多强”扭转到“世界代理让智能体强了多少”。此前 Chu et al. 用 L1 预测器/L2 仿真器/L3 进化器按“内在能力”给世界模型分级,是“模型中心”的;本文提出正交的“智能体中心”轴,刻意复用 L1–L3 的速记但重新定义:L1 推理时引导(仅增强上下文、不动参数)、L2 训练时优化(代理充当奖励/验证器/仿真器去改写策略)、L3 智能体-代理协同进化(真实环境证据同时更新双方)。与之配套的三个转变是:从“物理状态转移”到“信息转移”、从“逼真度/精度”到“信息增益”、从“一次性预测”到“闭环”。这一智能体中心视角正是过往综述未系统化的空白。

核心方法

整体思路是“先广义化定义、再用两轴铺开设计空间”。作者先把经典世界模型 $\hat{s}_{t+1}=\mathcal{WM}(s_t,a_t)$ 沿三轴推广为世界代理:把物理时间步 $t$ 推广为交互步 $\ell$(一次查询/渲染/执行/检索/验证都是“走了一步”);把状态转移推广为信息转移(输出可为未来状态、新视角观测、执行结果、检索到的记忆或技能、奖励或验证结果);把外部条件推广为智能体主动发起的交互 $u_\ell^\mathcal{F}$。在此统一抽象 $\hat{s}_{\ell+1}=\mathcal{WP}(s_\ell,u_\ell^\mathcal{F})$ 之上,论文用两条正交轴组织全部内容:横轴是 6 类功能形式(动力学/空间/执行/记忆/技能/奖励验证),纵轴是 3 层赋能深度(L1 推理引导/L2 训练优化/L3 协同进化),并在表6给出 6×3=18 格的代表性系统映射,空白格被标为待开拓方向。技术路线本质是“重构问题定义 + 建立分类法”,而非提出新模型或新实验。

核心创新是把“世界建模”的优化目标从“预测有多准/画面有多真”替换为“对智能体有多可用”——即把代理输出统一视为“信息转移”而非“状态转移”。与传统世界模型的关键区别有三:其一,传统世界模型只输出下一物理状态 $\hat{s}_{t+1}$,而世界代理的输出 $\hat{s}_{\ell+1}$ 可以是执行结果、检索到的经验或技能、或对计划的验证裁决,这些都算“agent 立即可用的新信息”;其二,交互不必然推进物理时间,一次记忆检索或空间渲染也算“走了一步”;其三,强调闭环——代理反馈必须回流到智能体的规划/决策/学习/持续改进,而非单次预言。这使得奖励模型、验证器、经验记忆、技能库、代码执行预测器等原本零散的模块,被统一纳入同一个“世界代理”范式下。

方法步骤详情

定义层面是一个四步闭环(图5):(1) 智能体按当前目标与上下文主动提出交互请求 $u_\ell^\mathcal{F}$;(2) 世界代理以信息状态 $s_\ell$ 与该请求为条件,预测信息转移 $\hat{s}_{\ell+1}$;(3) 反馈回传,可为未来状态、预测观测、执行结果、检索到的技能或验证裁决;(4) 智能体据此做规划、决策、策略学习与持续改进。三层公式不同:L1 仅把反馈拼入上下文($s^{agent}$ 做 $\oplus$ 合并),不改参数,故最轻、可逆;L2 把反馈当训练信号 $Train(agent,\hat{s}^{opt})$,转成 SFT/DPO/PPO/GRPO 目标去改写策略;L3 用真实环境证据同时更新代理与智能体 $CoEvolve(\cdot)$,二者协同进化、闭环最紧。文中用一个网页购物智能体贯穿三层:L1 点购买前先想象结果页、L2 把想象轨迹转成合成偏好对优化策略、L3 把真实轨迹回流共训代理,示范同一执行代理功能如何逐级加深角色。

技术新颖性

技术新颖性在于“统一抽象 + 正交分类”。新颖点一:用单一符号 $\mathcal{F}$ 把动力学预测、新视角合成(NeRF/3DGS)、执行仿真(浏览器/GUI/代码/shell/API)、经验与失败记忆检索、技能库推荐、奖励/验证(奖励模型/偏好模型/验证器/批评模型/LLM-as-Judge)六类异构能力收进同一个“信息转移”框架(表5逐一给出公式与代表系统)。新颖点二:把世界模型的“内在能力分级”与“对智能体的赋能深度”明确区分为两条正交轴(表4),纠正二者常被混用的认知。新颖点三:给出可操作判据——代理须满足接地性/可控性/反馈有用性/成本与可扩展性/前瞻性(表3),并明确“自信但错误的代理比没有代理更糟”。整体属于视角/综述类贡献,无新模型与新实验。

Conceptual shift and design space of Agent-Centric World Proxies.
Figure 1: Conceptual shift and design space of Agent-Centric World Proxies.
From World Model to World Proxy.
Figure 4: From World Model to World Proxy.
Agent-in-the-Loop World Proxy.
Figure 5: Agent-in-the-Loop World Proxy.
L1 to L3 World Proxies for Agent Improvement.
Figure 6: L1 to L3 World Proxies for Agent Improvement.
L1 Inference-Time Guidance via World Proxy.
Figure 7: L1 Inference-Time Guidance via World Proxy.
L2 Training-Time Optimization Driven by World Proxy.
Figure 8: L2 Training-Time Optimization Driven by World Proxy.
L3 Agent-Proxy Collaborative Evolution.
Figure 9: L3 Agent-Proxy Collaborative Evolution.
Functional forms of Agent-Centric World Proxies.
Figure 10: Functional forms of Agent-Centric World Proxies.

实验结果

需先说明:本文是立场/视角论文(position paper),无任何定量实验或基准测试,其“结果”是概念性结论。核心发现一:世界建模应从“预测世界”转向“服务智能体”,统一抽象为 $\hat{s}_{\ell+1}=\mathcal{WP}(s_\ell,u_\ell^\mathcal{F})$。发现二:设计空间可由 6 类功能 × 3 层赋能共 18 个格子刻画(表6),同一功能可随 L1→L3 从“顾问”升格为“教师”再到“伙伴”;其中空间代理在 L3、奖励/验证代理在 L3 被明确标为“underexplored/emerging”(空白格即研究机会)。发现三:四类真实环境瓶颈(表1)、三条代理要件、五大有效性准则、四类开放挑战(保真度与想象力的极限、何时该信任代理、奖励黑客与安全、需测信息增益的评测)共同构成一份研究议程。发现四:用一个网页购物智能体贯穿 L1(点购买前先想象结果页)/L2(想象轨迹转合成偏好对优化策略)/L3(真实轨迹回流共训代理)三层,示范同一执行代理功能如何逐级加深角色——顾问、教师、伙伴。

Bottlenecks of direct real-environment interaction.
Table 1: Bottlenecks of direct real-environment interaction.
From environment-centric prediction to agent-centric interaction modeling.
Table 2: From environment-centric prediction to agent-centric interaction modeling.
Criteria for effective World Proxies.
Table 3: Criteria for effective World Proxies.
Two orthogonal readings of the L1-L3 shorthand: intrinsic WM capability vs agent-centric empowerment.
Table 4: Two orthogonal readings of the L1-L3 shorthand: intrinsic WM capability vs agent-centric empowerment.
Functional forms of Agent-Centric World Proxies.
Table 5: Functional forms of Agent-Centric World Proxies.
Functions × Levels. Representative ways each proxy function empowers agents across L1, L2, and L3.
Table 6: Functions × Levels. Representative ways each proxy function empowers agents across L1, L2, and L3.
查看结构化数据
任务指标本文基线提升
(立场论文,无经验基准)世界代理设计空间的功能×赋能映射 6 类功能 × 3 层赋能 = 18 格设计空间覆盖率(表6) 6 功能(动力学/空间/执行/记忆/技能/奖励验证)× 3 层(L1/L2/L3)逐一映射到代表系统;标出空间×L3、奖励验证×L3 为 underexplored/emerging Chu et al. 的 L1-L3 按世界模型内在能力(预测器/仿真器/进化器)分级(表4) 新增正交的“智能体中心”赋能轴,把“代理让智能体强多少”与“代理自身多强”分离,并暴露空白研究机会

局限与改进

作者自身承认的四类开放挑战即其局限:生成式代理可能“看起来对却违反动力学”,长 rollout 误差累积,缺校准不确定性;智能体难以在线判断何时该信代理、何时回退真实环境;代理一旦充当奖励/验证器(L2)就引入奖励黑客与安全的新攻击面;现有基准只评代理自身的逼真度/可控度,不评“反馈是否真帮到智能体”。我的额外观察:作为立场论文,全文未给任何定量验证或消融,6×3 映射的格子归类带主观性;$\hat{s}_{\ell+1}=\mathcal{WP}(s_\ell,u_\ell^\mathcal{F})$ 的统一形式虽优雅,但不同功能(如奖励建模 vs 视频预测)在数据、训练目标、误差结构上差异巨大,“信息转移”的统一表述可能掩盖这些工程鸿沟;对 L3 协同进化的稳定性与灾难性遗忘几乎未展开。

独立分析的弱点

弱点一:缺乏可证伪的定量证据。改进方向是沿表6空白格(空间代理×L3、奖励验证×L3)做实证,并设计“信息增益”基准——测量反馈是否真提升规划/学习/改进,而非只评逼真度。弱点二:“何时信任代理”仅在开放挑战中点到,未给机制;可引入校准不确定性估计、置信度门控与“代理-真实”切换策略。弱点三:奖励黑客风险(L2)未给缓解方案,可结合对抗稳健奖励、约束验证与红队。弱点四:$\mathcal{WP}$ 的统一公式可能掩盖功能间鸿沟,建议为每类功能定义独立评测协议与接地度量。弱点五:L3 协同进化的训练稳定性、非平稳目标、代理与策略的漂移未深入,需借鉴在线 RL 与持续学习方法。弱点六:缺少与既有 MBRL/RLHF 综述的边界厘清。

未来方向

作者明确提出的未来方向即四类开放挑战的落地:提升保真度并引入校准不确定性以对抗长程误差累积;研究在线“信任仲裁”机制让智能体决定信代理还是回真实环境;针对 L2 奖励黑客设计安全沙箱与稳健奖励;构建智能体中心评测——度量信息增益而非孤立逼真度。基于成果可延伸的方向:其一,把表6空白格(空间×L3、奖励验证×L3)作为优先研究路线,例如让 NeRF/3DGS 渲染器与真实采集形成在线共进化闭环;其二,建立标准化的“代理 API”与交互协议,使不同功能可插拔组合;其三,探索跨模态代理与多智能体共享代理;其四,把“信息增益”形式化为可优化目标,连接信息论与 RL;其五,研究 L3 中代理与策略协同更新的稳定性理论。

复现评估

作为立场/综述论文,本文无可复现的实验:无模型权重、无训练超参、无数据集、无用于复现数值结果的代码。但论文提供了项目页(worldbench.github.io/awesome-agentic-world-model)与 GitHub 仓库(worldbench/awesome-agentic-world-model),定位为“awesome 列表”式文献聚合,便于读者按 6 类功能与 3 层赋能检索相关系统。算力需求为零(纯写作),复现难度在于“复现其论证”而非“复现其数字”:读者需自行在所选格子中实现一个世界代理并验证“信息增益”假设。因此可复现性应理解为“框架可落地性”——抽象清晰、定义明确、表格可对照,但缺一份端到端参考实现来示范如何把六类功能拼进同一个 $\mathcal{WP}$ 接口。