← 返回 2026-08-07

从经济智能体到智能体经济:经济世界模型的系统实现蓝图 From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models

Jiale Han, Xiang Li, Jing Qian, Wenyuan Gu, Pin Gao, Ye Luo, Hongyuan Zha, Dacheng Tao, Benyou Wang, Lin William Cong 📅 2026-08-06 👍 33 2026-08-11 18:30
LLM智能体 多智能体模拟 强化学习环境 文献综述 系统蓝图 经济世界模型

为经济世界模型提出六级能力阶梯与可复用模块化实现协议

前置知识

世界模型(World Models)

AI/RL中学习环境动力学 $\hat{s}_{t+1}=\mathcal{T}(s_t,u_t)$ 的模型,让智能体在潜空间想象未来、评估动作、在仿真中规划。代表如V-M-C、JEPA、DreamerV3,围绕单一具身智能体、以潜向量压缩高维感知流。

本文把世界模型从物理环境推广到经济环境,理解这一推广与差异是读懂EWM的前提。

基于主体的模型(Agent-Based Model, ABM)

自下而上模拟经济的方法:把经济体建模为多个自主交互的主体(如家庭、企业、银行),每个按预设规则(阈值、启发式或基于数值状态训练的策略)行动,通过交互涌现出总量规律(如波动、危机)。Kim & Markowitz(1989)、Tesfatsion的ACE、ABIDES是其代表。

ABM是EWM最直接的相邻范式,理解ABM的规则化决策局限才能看出EWM引入语言推理与内生制度的价值。

LLM智能体(LLM Agents)

以大语言模型为认知基底、配备人格、记忆、工具调用、反思能力的智能体,能在经济/金融任务中形成信念、做上下文敏感决策。近期证据(Bini et al. 2025)显示LLM在偏好类任务有系统偏误,需行为校准而非仅靠persona提示。

L3及以上的EWM依赖LLM智能体作为认知算子 $\mathcal{B}_i$,是理解能力阶梯跃迁的关键。

强化学习环境(RL Environment)

提供状态、动作、转移动力学与奖励信号的交互环境(如Gym/Gymnasium接口 reset/step)。智能体通过反复rollout学习策略,环境决定可学到的行为。ABIDES-Gym、AI Economist把市场/政策建模为RL环境。

本文把EWM明确设计为'环境包'式接口(ewm.make/reset/step),并作为LLM的RL训练环境是其三大应用之一。

经济学均衡与DDGE

均衡(Nash均衡、一般均衡、DSGE)是传统经济学闭合系统的方式:通过理性预期与最优化一阶条件导出行为。Cong(2025)的Data-Driven Generative Equilibrium(DDGE)处理行为、信念、数据生成与习得环境联合内生时的反事实一致性,作为EWM的经济固定点纪律。

本文反复强调能力级别不保证反事实一致性,需DDGE式闭包补足——这是理解EWM经济有效性的理论锚点。

研究动机

经济学长期遵循'观察-解释/预测'的传统范式:经济学家观察总量变量、收集微观证据、估计经验关系或因果效应、构建理论与量化模型,追问'什么导致了什么'。这一路径虽强大,却留下更深层的'生成性解释'难题:求出均衡、拟合参数或预测拐点本身并不能解释一个经济现象,除非结果能从模型'内部'涌现。本文的文献综述(1950至2026年4月)实证揭示了现状的局限:在7836篇候选论文中,最终验证通过的737篇EWM论文绝大多数停留在L1-L3(固定规则、自适应规则、LLM自主智能体),而具备自演化智能体(L4)、内生制度演化(L5)、与现实观测持续对齐(L6)的系统极为稀少。更根本的是,物理世界模型无法直接迁移——经济状态转移由异质主体的信念、预期与策略交互内生驱动,而非外部客观物理定律,牛顿那句'我能计算天体运行,却无法计算人的疯狂'正点出症结。

本文的目标是本文的核心目标是把Cong(2025)提出的'经济世界模型'(EWM)议程从概念框架转化为可工程化的CS/AI系统蓝图。具体而言,作者要回答:如何把这样的经济世界实现、评估并扩展为可用于智能体训练、政策沙盒、规划引擎、sim-to-real经济孪生的计算环境?论文给出操作性工作定义——EWM是'为经济环境而设的生成引擎',通过建模异质主体如何在经济制度与约束下观察、推理、行动、交互并适应,预测经济的演化轨迹 $s_{t+1}=\mathcal{T}(s_t,u_t)$。目标是让经济推理变得可操作、可实验:既作为人类决策者的高保真沙盒,也作为AI智能体的训练、规划与评估基底,从而推动从孤立的经济智能体迈向完整的'智能体经济'(Agentic Economy),把单向的下一动作预测问题变成主体侧与世界侧之间的工程化闭环。

与已有工作不同的是,本文的独特切入角度是把EWM明确放在CS/AI系统视角而非纯经济学理论视角下审视。与Cong(2025)侧重把EWM作为经济模型类别、发展DDGE均衡纪律不同,本文追问'这样的经济世界如何作为计算环境被实现、评估和扩展'。该视角带来三项独特贡献:其一,提出六级能力阶梯(L1-L6)作为实现成熟度的分类标准,而非均衡概念;其二,把EWM运行时分解为四层模块(智能体层、环境层、协同演化层、现实对齐层);其三,提供一套可复用的实现协议(ewm.make/reset/run_agents/step/coevolve/align/evaluate)。这种'系统蓝图'式定位填补了'如何系统化构建可扩展、可对齐、可验证的经济世界'的工程空白,并把分散的模块级原型(如AlphaPortfolio、AlphaManager、ABIDES、AI Economist)整合为统一架构起点。

核心方法

直觉上,本文把EWM理解为'经济主体与经济世界互为表里'的系统:智能体学习个体经济主体下一步做什么 $a_t=\pi(s_t)$,而EWM预测整个经济会变成什么 $s_{t+1}=\mathcal{T}(s_t,u_t)$,两者构成EWM运行时核心的动作-状态闭环。技术路线分四步推进。首先用操作性定义界定EWM为'为经济环境而设的生成引擎',并系统区分物理世界(状态转移由外部稳定定律驱动)与经济世界(状态转移由异质主体的信念与策略交互内生驱动),点明主观主体、内生结果、反身性反馈、自适应动力学四大特征。然后提出四个工程应满足性(内生闭合、行为保真、协同演化、现实对齐),把它们操作化为六级能力阶梯:L1固定规则→L2自适应规则→L3 LLM自主→L4自演化智能体→L5演化经济世界→L6 sim-to-real经济孪生。接着用两阶段LLM辅助筛选(737篇)实证刻画文献景观。最后给出模块化运行时架构与可复用实现协议。整体思路是'先定义、再分级、后工程化'。

核心创新是EWM的'状态转移算子分解'。与单一预测器不同,本文把转移算子分解为五阶段:信念更新 $b_i^{t+1}=\mathcal{B}_i(b_i^t,z_i^t,x_t,u_t,\mathcal{I}_t)$、动作生成 $a_i^{t+1}=\pi_i(z_i^t,b_i^{t+1},x_t,u_t,\mathcal{I}_t)$、主体状态更新 $z_i^{t+1}=\Omega_i(z_i^t,a_i^{t+1})$、内生聚合 $x_{t+1}=\mathcal{G}(\{z_i^{t+1},a_i^{t+1},b_i^{t+1}\},x_t,\mathcal{I}_t)$、规则演化 $\mathcal{I}_{t+1}=\Phi(\mathcal{I}_t,x_{t+1})$。经济状态 $s_t=(x_t,\{z_i^t,b_i^t\},\mathcal{I}_t)$ 同时含总量状态、私有状态、信念状态与制度环境,结构化状态快照使下一转移可执行,区别于物理世界纯客观状态向量。该分解使EWM可构建:智能体生成动作、世界生成状态、对齐锚定现实。

方法步骤详情

方法分五部分。第一步定义经济状态与转移算子:状态含总量状态 $x_t$、$N_t$ 个主体私有状态 $z_i^t$ 与信念状态 $b_i^t$、制度环境 $\mathcal{I}_t$。第二步六级能力分类:L1的 $\mathcal{B}_i,\Phi$ 均不活跃;L2决策规则 $\pi_i^t$ 时变但认知算子不活跃;L3激活 $\mathcal{B}_i$,引入信念、记忆与语言推理;L4智能体通过经验获得新技能并持久重塑 $\mathcal{B}_i,\pi_i^t$;L5激活 $\Phi$ 使制度内生演化;L6加外环在线校正。第三步文献收集:从arXiv八类目与UTD-24用交集关键词过滤得7836篇候选(6008 arXiv+1828 UTD-24)。第四步两阶段LLM筛选:GPT-5.4-mini标题摘要筛选→794+87篇;GPT-5.5全文分级→737篇验证通过,边缘案例人工复核。第五步实现协议:ewm.make装配、reset初始化、run_agents生成动作、step转移、coevolve双向更新、align现实对齐、evaluate评估,配五层评估指标。

技术新颖性

技术新颖性体现在三方面。首先是六级能力阶梯这一'实现成熟度分类法':它把'智能体智能'(L1→L4)、'规则内生演化'(L5)、'现实在线校正'(L6)明确为三个正交维度,用✓/◐/✗标记每级对四个工程应满足性的满足程度。其次是'可复用实现协议':把EWM的规范接口(agents/environment/coevolution/alignment/evaluation)与运行时接口(reset/run_agents/step/coevolve/align/evaluate)分离,使公开循环紧凑而把更丰富机制藏在运行时背后。第三是把'五大工程浪潮'(特征→数据→提示→上下文→环境工程)映射到六级能力,揭示EWM是'持续的工程演化的逻辑产物而非凭空跳跃'。此外,论文用迭代协同改进循环(图2)阐明'智能体训练EWM、EWM训练智能体'的共生关系,并把'内生聚合算子 $\mathcal{G}$'与'制度演化算子 $\Phi$'作为一级模块,这是相对ABM与LLM社会模拟的本质区别——它们通常把环境当固定舞台而非内生闭合经济体。

Iterative co-improvement between Economic Agents and an EWM.
Figure 2: Iterative co-improvement between Economic Agents and an EWM.
State transition in an Economic World Model.
Figure 3: State transition in an Economic World Model.
Core components of an Economic World Model.
Figure 7: Core components of an Economic World Model.
Reusable implementation protocol for EWMs.
Figure 8: Reusable implementation protocol for EWMs.

实验结果

本文是立场/综述性论文,核心'结果'是文献景观的实证刻画。从1950至2026年4月检索的7836篇候选出发,经两阶段LLM筛选得737篇验证通过EWM论文。图6揭示三个关键发现。第一,智能体智能是近期主战场——arXiv论文在2024-2025年急剧增长,集中在L1-L3(尤其自适应规则与LLM自主智能体),但'L4-L6相对L1-L3在视觉上仍很小',即智能体能力扩张尚未被'演化中的经济世界'扩张匹配。第二,商科与经济学期刊(UTD-24)体量更小更稳定,'几乎完全集中在L1和L2',反映更强的经济纪律与制度结构,但极少引入LLM自主智能体、持久自演化或sim-to-real校正。第三,L4-L6系统仅占'薄层':L5内生制度演化'甚至更稀少',L6 sim-to-real孪生'几乎缺席',仅见极有限反复校正证据(Wiesinger 2010逆向工程交易者、Evans 2025校准ABM)。这凸显'在同一经济世界内整合自演化智能体、演化制度、在线现实对齐'的核心系统难题仍是前沿空白;arXiv与UTD-24形成AI新能力与经济建模传统的分工。

Physical vs. economic worlds.
Table 1: Physical vs. economic worlds.
Capability levels of EWM systems.
Table 2: Capability levels of EWM systems.
Layered evaluation targets for Economic World Models.
Table 3: Layered evaluation targets for Economic World Models.
How engineering waves relate to EWM capability levels.
Table 4: How engineering waves relate to EWM capability levels.
Positioning Economic World Models (EWMs) among adjacent paradigms.
Table 5: Positioning Economic World Models (EWMs) among adjacent paradigms.
Representative systems by EWM level.
Figure 5: Representative systems by EWM level.
Literature landscape of EWM papers across years, source types, and capability levels.
Figure 6: Literature landscape of EWM papers across years, source types, and capability levels.
Applications of EWMs.
Figure 18: Applications of EWMs.
查看结构化数据
任务指标本文基线提升
EWM文献全景系统化分级 验证通过论文数与筛选保留率 737篇验证通过EWM论文(保留率约9.4%) 7836篇候选池(6008 arXiv + 1828 UTD-24) 建立首个跨1950-2026、跨arXiv与顶刊的EWM系统化文献库与分级体系
高级能力(L4-L6)系统覆盖度 在验证语料中的占比与可及性 L4-L6仅占薄层,L6 sim-to-real孪生近乎缺席 L1-L3主导(尤其2024-2025 arXiv增长集中在L1-L3) 精确定位'自演化智能体+内生制度+在线现实对齐'三合一的核心研究空白
可复用实现协议完整性 规范接口与运行时接口数 5类规范接口 + 7个运行时接口 + 5层评估指标 分散的模块级原型(AlphaPortfolio/AlphaManager/ABIDES/AI Economist等) 提供统一架构起点与API契约,把组件级原型整合为系统蓝图
范式定位清晰度 与相邻范式的维度区分 在异质性/适应/信念/内生价格/宏观-微观一致/经验接地等维度兼具优点(Table 5) 传统经济模型/ABM/社会模拟/物理世界模型各自覆盖部分维度 澄清EWM边界,避免与ABM或LLM社会模拟混为一谈

局限与改进

作者坦承的局限性有三方面。其一,本文是CS/AI系统视角的'研究议程'而非'完成的技术配方',能力级别本身'并不能保证DDGE式的反事实一致性'——一个高级EWM仍可能在'错误的习得环境'下评估反事实。其二,论文明确其'立场性':与Cong(2025)互补,把均衡与反事实有效性理论留给EWM/DDGE框架。其三,实现协议是说明性伪代码(如ewm.make/world.step),而非已发布的可运行库,FX市场示例(1000家庭+20企业+5银行)未附实际仿真结果。我补充几点观察:六级分类存在主观性,GPT-5.5分级依赖具体LLM,'边缘与低置信案例'虽有人工复核但可重复性受模型版本影响;文献检索截至2026年4月且依赖关键词交集,可能遗漏用非标准术语描述的相关工作;表格中✓/◐/✗为定性标记缺乏量化阈值;论文未给出任何端到端EWM系统的实证验证数据(如价格误差、清市误差),更多是框架性论证。

独立分析的弱点

独立分析的弱点如下。第一,可扩展性与计算成本:异质主体交互、长时域rollout、内生市场机制、对真实数据校准均'施加可观资源成本',且随主体数、时间步、推理复杂度增长;改进方向是分层近似(用 cheaper 认知基底处理多数主体、LLM只用于关键决策)、异步并行架构与事件驱动仿真。第二,行为真实性校准:LLM智能体在偏好类任务存在系统性偏误(Bini et al. 2025),'人格提示不足以替代行为验证';改进方向是建立标准化的经济行为基准与校准流程,把信念校准纳入运行时。第三,世界级评估困难:反事实世界'没有单一真值轨迹';改进方向是分布级与机制级评估组合(价格误差、清市误差、会计一致性、风格化事实匹配)。第四,均衡纪律与实现能力的脱节:改进方向是把DDGE式闭包内嵌入运行时,对习得组件在反事实生成的数据上重新对中。第五,制度演化稳定性:$\Phi$ 激活后易'漂移到不现实或不稳定动力学';改进方向是引入有界更新(bounded_update)、会计与市场不变量约束、以及'演化触发条件'的形式化。

未来方向

作者在第八节明确列出六大开放挑战:行为真实性(如何用真实行为数据对齐与校正模拟主体)、经济闭合(需要既经济守纪又计算可扩展的非线性聚合机制,处理战略交互、市场出清、网络溢出、瓶颈与反馈环)、协同演化(决定'什么该演化、何时演化、如何防止漂移')、计算与工程可扩展性、世界级评估(主体级与世界级双重评估,检验是否生成合理的价格、配置、分布、网络结构、危机动力学与政策响应)、经济有效性与均衡纪律(用DDGE式闭包补足系统架构)。基于本文成果可延伸的方向包括:把六级阶梯操作化为可量化打分卡并建立跨模型复现基准;实现一个最小可运行EWM参考库以验证协议可行性;构建跨领域(外汇/信贷/税收/劳动力)的标准化EWM基准套件;探索LLM智能体在多智能体经济中涌现的合谋、不稳定、操纵、级联失效并设计安全护栏;把EWM作为RL训练环境,训练出能在真实经济中部署的决策智能体(类AlphaPortfolio的泛化);以及研究智能体-世界协同改进循环的理论收敛性。

复现评估

复现性分两方面。文献综述部分可较高复现:作者公开了关键词列表与检索协议(Appendix A.1)、两阶段LLM筛选流程(Appendix A.2),并维护了一个精选论文列表与资源库(github.com/FreedomIntelligence/Awesome-Economic-World-Models)。然而分级依赖GPT-5.4-mini与GPT-5.5这两个具体模型,模型版本更迭会影响复现一致性,所幸有'边缘与低置信案例人工复核'保底。系统实现部分复现性较低:ewm.make/world.step等是说明性伪代码与协议规范,并非已发布的可运行Python库,FX市场示例未附实际仿真代码或结果数据,论文也未给具体算力预算。整体而言,综述方法论中等偏上可复现,工程实现需社区协作从零构建参考实现。难度评估:文献复现中-高(需访问arXiv/WoS与特定LLM),系统实现高(需整合智能体、机制、对齐、评估四层并解决可扩展性)。作者明确呼吁'构建可信、可扩展、经验接地的EWM需要跨AI、经济、管理、社科、政策的社区努力'。