穷人版智能体建模:在笔记本电脑上模拟大规模LLM智能体社会 Poor Man's Agentic Modeling: Simulating Large LLM-Agent Societies on a Laptop
用几美元LLM查询克隆出的低参数代理模型,在笔记本上复现大规模LLM社会模拟的宏观规律
前置知识
LLM多智能体社会模拟
用大语言模型充当每一个智能体(市民、家庭、选民)来构建生成式社会:如Generative Agents的小镇、EconAgent的LLM宏观经济、OASIS的社交媒体社会。每个智能体对输入做一次LLM推理并产生决策,大量智能体的涌现行为再现出商业周期、舆论极化等宏观现象。
本文的出发点正是这类模拟:它们每次千级智能体运行需数十美元和数十小时API调用,作者要回答的就是何时能用廉价代理替换其中的LLM而不失宏观保真度。
行为克隆(Behavioural Cloning)
一种模仿学习:在若干(状态, 动作)样本上监督训练一个参数化策略 $\hat{\pi}_\theta(s)$,使其逐点复现教师策略的动作,而不需要环境奖励信号。本文用几百到几千次真实LLM决策作教师数据,拟合每个代理智能体的2到12个参数。
这是整个方法的数据来源:代理模型的参数通过对DeepSeek等真实LLM在其提示词上的决策做行为克隆得到,宏观观测量从不进入拟合,因此仍是样本外检验。
平均场理论与粗粒化
统计物理中用集体变量(如总体均值)近似多体系统的方法:当每个粒子感知的是全系统平均量时,系统可用单个'平均粒子'精确描述,有限尺寸误差由中心极限定理给出 $N^{-1/2}$ 衰减。粗粒化即把微观自由度投影到少数宏观变量上。
论文的[交互阶×记忆]分类法直接建立在平均场有效理论之上:全局感知对应平均场单元(标量代理误差 $\sim N^{-1/2}$),社区/局部感知则留下 $O(1)$ 误差底。
Jensen不等式与响应曲率
对凸函数 $f$,$\mathbb{E}[f(x)] \geq f(\mathbb{E}[x])$。当每个智能体感知的信号带有噪声 $\delta$ 且响应 $A(\cdot)$ 非线性(曲率 $A'' \neq 0$)时,噪声平均后的响应 $\mathbb{E}[A(g^*+\delta)]$ 与无噪声响应 $A(g^*)$ 之差(Jensen偏差)在小 $\sigma$ 下近似 $\frac{1}{2}A''(g^*)\sigma^2$,不为零。
这是论文最精妙的定量预测来源:强饱和响应的代理误差不随 $N$ 下降,而是停在曲率地板上(实测0.018恰好等于解析预测的Jensen偏差),且由此可预先算出拐点 $N^*$。
Mori–Zwanzig记忆核
约化动力学理论:把系统投影到少数慢变量后,被积分掉的自由度表现为对历史轨迹的卷积依赖,即记忆核 $K(\tau)$。若记忆可截断为有限滞后,动力学可写成 $a_{t+1}-a \approx \sum_\tau K(\tau)(p_{t-\tau}-a)$。
分类法的'记忆'轴对应此概念:论文实测了DeepSeek态度更新中的离散记忆核,发现过去交互尾巴达当前权重的47%,证明LLM智能体确实是非马尔可夫的。
研究动机
用LLM作为每个智能体的社会模拟(Generative Agents小镇、EconAgent宏观经济、OASIS社交网络等)虽然能无手工规则地涌现出商业周期、舆论极化、流行病波等人类群体宏观现象,但成本极高:一次千级智能体运行需要数十美元和数十小时的API调用,使得系统性研究——尤其是观察量如何随智能体数 $N$ 标度——对多数研究者完全不可及。更根本的问题是,这类模拟买来的是单智能体认知,而研究者向它提问的问题几乎总是宏观的:是否发生相变、聚合量有何典型事实(stylised facts)、观测量随 $N$ 如何标度。花大钱购买微观认知却只问宏观问题,存在明显的不匹配,但此前没有工作回答'何时可以安全地把昂贵LLM智能体换成廉价模型'。
本文的目标是本文要建立一个可事先使用的判据:给定一个LLM社会模拟的设计,在拟合任何模型之前就能预测'用低参数代理模型替换每个LLM智能体后,宏观观测量的代理误差随 $N$ 如何变化'(衰减、平台还是增长)。在此基础上给出一条完整流水线(算法1):先按感知设计分类到[交互阶×记忆]分类法的单元,筛选掉会计恒等式型观测量,用几百到几千次廉价LLM查询(几美元)做行为克隆得到每个智能体的2-12参数代理模型,从拟合的响应函数读出误差地板和拐点 $N^*$,然后在笔记本上以任意 $N$ 运行代理社会,验证宏观观测量并核对误差趋势是否符合单元的先验预测。
与已有工作不同的是,最接近的先前工作MF-LLM把总体均值场耦合进每个智能体的LLM决策,保留了LLM在环但不分析标度;社会物理学提供低参数规则(投票者、Ising模型)但不回答哪个规则对应哪个LLM智能体;粗粒化与方程学习压缩动力学但不处理有限 $N$ 闭合问题和LLM特定目标。本文的独特切入是三点结合:(1)用真实LLM决策(在其自身提示词上引出,DeepSeek全程仅花几美元)做行为克隆来构造每智能体低参数代理;(2)提出并盲测[交互阶×记忆]感知分类法,预测代理误差的 $N$ 趋势;(3)把代理拟合当成测量仪器而非省钱手段——复现宏观定律所需的那个微观参数本身就是对'什么产生了这条宏观定律'的测量。
核心方法
直觉上,把每个智能体换成'平均智能体'能成立,当且仅当总体确实被其均值充分概括,而决定这一点的正是每个智能体看什么。若所有智能体都对同一个总体聚合量(通胀率、全局趋势流)做反应,它们同涨同落,均值是充分统计量,唯一误差是随 $N^{-1/2}$ 洗掉的采样噪声——这是平均场单元。若智能体感知的是社区内共享或图邻居局部的信号,均值丢弃了真正驱动它们的结构,误差不再随 $N$ 下降甚至增长。技术上,论文设 $\Phi_t$ 为微观更新、$P$ 为到宏观观测量的投影,代理用低参数映射 $\hat{\Phi}_t$ 替换,误差由交换缺陷 $\|P\Phi_t - \hat{\Phi}_t P\|$ 驱动;算法1依次执行:分类感知单元(先验预测误差趋势)、先验筛选观测量、在目标模拟自身提示词上引出并缓存真实LLM决策(几千次、几美元)、行为克隆2-12参数代理、从拟合响应读出地板与拐点、几何级数扫 $N$、把宏观值与文献发表值和单元预测对照验证。
核心创新是把'代理能否成功'从经验问题变成可先验判定的设计问题:感知设计决定一切。作者提出交互阶(全局聚合=0阶→平均场,误差 $\sim N^{-1/2}$;固定块数社区共享→误差只剩 $O(1)$ 地板;图邻居局部→由度结构控制)和记忆(无/有内部状态,长记忆需Mori–Zwanzig核闭合)两条轴构成分类法,每个单元命名有效理论、误差 $N$ 趋势和所需最小闭合(标量均场、块/graphon均场、对近似+记忆核)。与已有方法的本质区别在于:参数通过对真实LLM决策的行为克隆估计,而非拟合目标宏观值 $M^\star$,所以宏观观测量永远是样本外测试;且分类是预注册的、盲执行的。另一关键洞见是强曲率响应经Jensen不等式在私有馈送下也留下不消失的误差地板 $|m_1| \approx \frac{1}{2}|A''(g^*)|\sigma^2$,拐点 $N^* = v_1/m_1^2 \approx 4A'(g^*)^2/(A''(g^*)^2\sigma^2)$ 可在运行前算出。
方法步骤详情
算法1共七步,输入为目标LLM模拟 $S$ 的感知/记忆规范、宏观观测量 $M$ 及其发表值 $M^\star$,输出为可在许可的任意 $N$ 复现 $M$ 的低参数代理及先验误差趋势预测。第一步 classify_cell:把感知与记忆设计映射到(交互阶,记忆)单元,在任何拟合之前预测误差趋势。第二步 筛选 $M$:若无行为策略(如Bernoulli(0.5))已能复现它则拒绝——它是会计恒等式。第三步 引出决策:在 $S$ 自身的提示词上、小状态网格上查询LLM(主用DeepSeek-chat,经Anthropic兼容端点),决策缓存到磁盘,付费运行有硬预算护栏,3000与6000次决策分别花费$0.44和$0.67。第四步 克隆:拟合12参数学生——两个logistic头(工作决策、消费倾向),各对6个特征(偏置、3个标准化状态量、利率、宏观信号 $g$)线性,使宏观量从不进入拟合。第五步 读地板:perception_floors从拟合响应解析算出误差地板和拐点 $N^*$。第六步 扫 $N$:以 $N \gg N_{target}$ 几何级数运行代理社会测 $M(N)$(EconAgent环境在NumPy中按发表代码忠实重实现,链接劳动、累进税、消费、储蓄四个组件)。第七步 验证:$M(N)$ 对照 $M^\star$,误差趋势对照单元预测,全部预注册。
技术新颖性
技术新颖性体现在四层。第一,分类法本身是把统计物理的闭合理论(BBGKY层级、Mori–Zwanzig记忆核、graphon)转译成LLM模拟设计层面的可操作判据,作者明言这是组织性启发而非定理,并用三个命题把它在均场单元做成精确结果:仿射/曲率响应下全局馈送的缺陷同为 $C/\sqrt{N}$(命题3),异质感知重引入Jensen地板,私有馈送下误差 $\mathbb{E}|\mathcal{N}(m_1, v_1/N)|$ 在 $N^*=v_1/m_1^2$ 处出现拐点(命题2)。第二,误差传播引理(Lemma 1)用离散Grönwall递推 $e_{t+1} \leq \epsilon_t + Le_t$ 给出单步地板何时控制可观测量:收缩($L<1$)时 $e_T \leq \epsilon/(1-L)$,中性时 $T\epsilon$,扩张时仅短视界可控。第三,在真实LLM上实测了两个此前只有理论假定的轴:感知(2×2消融证明是推理步骤而非提示措辞产生Phillips曲线)与记忆(回归出离散Mori–Zwanzig核,$K(0)=0.27$、尾巴为 $K(0)$ 的47%)。第四,可复用的两个原语 classify_cell 与 perception_floors 先在标度已知精确解的Minority Game和网络流行病上认证(临界参数恢复到13%以内),再用于LLM目标。
实验结果
RQ1-预测:预注册的盲测全部通过——在留出的接触图上均场单元误差随 $N$ 收缩、社区单元停在 $O(1)$ 地板、局部单元跟随度结构,三者在大 $N$ 的排序与分配完全一致。在真实DeepSeek响应函数上,近线性消费头的5条预注册预测全中(全局与私有误差按 $N^{-1/2}$ 衰减、社区误差平坦于 $O(1)$、地板按 $B^{-1/2}$ 下降、块感知代理可修复);强饱和工作头 refute 了2条,其私有馈送误差停在0.018的地板——事后分析显示无限总体的Jensen偏差恰为0.018,无自由参数匹配,且由同一曲率常数预测了社区地板 $B^{-1/2}$ 衰减被压缩($B=5$到80比值实测1.93对理想4.0,受Jensen水平限制约2.0)。拐点验证:工作头 $N^* \approx 29$($N=100$到3200已平坦),消费头 $N^* \approx 2.5 \times 10^4$(持续改善),与命题2一致。跨13条引出轨迹、5个实验室(DeepSeek/OpenAI/Anthropic/Google/Meta)的重测中12/13通过核心预测,唯一例外是最小的gpt-4o-mini;膝点随各模型曲率从 $10^5$ 量级移到 $\sim 140$。RQ2-复现:EconAgent克隆Phillips为 $-0.569 \pm 0.138$,与发表值 $-0.619$ 差0.05,作为样本外预测成立;De Marzo共识的 $P(m) = \frac{1}{2}[\tanh(\beta m)+1]$ 形式在新模型上转移,测得Opus-4.8与GLM-5.2计数完美($N_c=\infty$)、DeepSeek平坦 $\beta_{eff} \approx 1.9$($N_c=\infty$)、GPT-4-Turbo $\sim 1600$、GPT-4o $\sim 900$、Llama-3.3-70B $\sim 1600$,与原文Llama-3约50为有限、其余为下限的结论在有限/无限二分上一致;把 $(n_k, n_z)$ 显式喂给GPT-4o可将其衰减的 $\beta_{eff}$ 变平、$N_c \to \infty$,证明临界群规模是感知阈值而非热力学相变。共复现八个具名LLM模拟(EconAgent、AgentTorch、OASIS、AgentSociety、De Marzo共识博弈、Williams生成式流行病、LLMTraveler拥塞博弈、Smallville)加一个可微ABM跨域检验。RQ3-机制:Okun定律被先验判为会计恒等式(GDP与就业是 $R^2=0.996$ 的仿射关系,无行为Bernoulli(0.5)策略即得 $-0.998$),Phillips曲线才是真行为签名;2×2消融显示无推理时克隆Phillips为 $-0.43$(平实措辞)/ $+0.04$(放大措辞),开推理后为 $-0.73$ / $-0.66$——是推理步骤而非措辞产生Phillips曲线;Table 1的前沿分析显示只有价格键控劳动通道可达 $-0.80$(覆盖发表值 $-0.62$),反周期消费饱和于 $\approx -0.43$,就业反馈劳动甚至给出错误符号 $+0.40$。记忆核测量:$K(0)=0.27$ 低于无记忆拟合率 $\mu=0.415$( conviction-braking 签名),尾巴为 $K(0)$ 的47%且集中于前几阶滞后。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| EconAgent宏观Phillips曲线复现(样本外) | 失业-通胀相关系数(24种子) | -0.569 ± 0.138(克隆代理,N=100) | 发表值 -0.619;教师DeepSeek推理提示克隆 -0.665 ± 0.12 | 与发表值差 |Δ| = 0.05,落入噪声范围;非价格键控教师经同一流水线给出消失的Phillips |
| Okun定律先验筛选 | 无行为策略可复现的相关系数 | Bernoulli(0.5)策略即得 -0.998 | 发表值 -0.918 | 证明Okun是会计恒等式(GDP与就业为R²=0.996仿射关系),复现它不验证任何行为 |
| 感知轴盲测(真实LLM响应,13条轨迹×5实验室) | 预注册预测通过数 | 12/13模型通过核心三预测;消费头5/5全中 | 标量均场基线(无块感知闭合)在社区馈留下O(1)误差 | 唯一失败者gpt-4o-mini方向正确但未达2×判据;曲率两处refute被理论以0自由参数定量匹配(地板0.018) |
| De Marzo临界群规模Nc | βeff(N) 穿越 βc=1 的位置 | DeepSeek平坦βeff≈1.9→∞;GPT-4o~900;GPT-4-Turbo~1600; tally干预使Nc→∞ | De Marzo原文:Llama-3-70B≈50,更强模型仅下限≳1000 | 有限/无限二分与原文一致;干预实验揭示Nc是感知(列表→计数)阈值而非动力学阈值 |
| 闭合机制认证(已知精确解) | Minority Game临界控制参数恢复误差 | 13%(有限尺寸标度数据塌缩) | 精确已知值 | 据此设定工具箱分辨率地板约15%,低于此不读精度 |
局限与改进
作者坦承的局限:(1)具名目标的复现是机制与标度匹配,仅两个目标在新模型上复现了发表的功能形式而非其原模型的发表数字,最强检验(用目标原模型命中其发表宏观数)仍然开放;(2)EconAgent市场是代码校准的忠实重实现,用发布的非LLM基线验证,DeepSeek决策驱动的是智能体而非市场力学;(3)交换缺陷分解是组织性启发而非定理,各项未推导、常数未界定;(4)预注册虽绑定具体数值预测和否决判据,但都提交在作者自己的仓库,git历史本身无法区分预测与数据,仅靠外部时间戳DOI(含SHA-256)锚定内容,锚定的是存入时间而非预测时间;(5)LLM层结果主要依赖一个模型,姊妹模型上宏观值会移动(作者认为这本身是发现的一部分)。我自己的观察:其一,DeepSeek作为默认教师,其决策的分布外泛化和跨供应商稳定性只在13条轨迹检验中部分覆盖;其二,代理只在观察量非扩张($L \leq 1$)区域可靠,近临界单元需长视界读数,而论文并未给出系统判定 $L$ 的实用程序;其三,'会计恒等式筛选'依赖能构造行为无关策略,对无法这么做的观测量(如Smallville的社会行为)判别力有限,TwinMarket只能作为边界案例记录。
独立分析的弱点
弱点一:强饱和响应的两处refute虽被Jensen理论事后定量解释,但说明perception_floors原语在曲率 $|A''|$ 大的头上并非先验可靠——拐点 $N^*$ 的解析式基于折叠正态近似,与经验读数差约一个量级(29 vs ~140),使用者若无二次诊断容易误判单元。改进方向:把曲率诊断纳入第一步分类,输出'该单元预测可信度'而非单一标签。弱点二:误差传播要求代理映射 $L$-Lipschitz且非扩张才可观测量继承单步趋势,但论文没有提供从拟合参数估计 $L$ 的标准流程,近临界单元的判定仍靠人工长视界读数。改进方向:在学生拟合中加Lipschitz正则或从数据直接估计收缩率,把'读多长视界'也自动化。弱点三:预注册绑定在自建仓库,外部审计无法从git史区分预测与数据,时间戳DOI只证明存入时点。改进方向:采用第三方预注册平台(OSF)或commit-签名+可信时间戳的组合。弱点四:主结论绑定DeepSeek与GPT系模型,越强的推理模型(Opus-4.8、GLM-5.2)行为越理想化(计数完美),这暗示方法在'更像理想比例感知器'的前沿模型上可能遇到越来越小的可测偏差,效应量缩小。改进方向:把工具投向偏差更大的中小模型和真实部署的推荐器配置。弱点五:会计恒等式筛选需要能显式构造行为无关基线,这在某些领域(生成式小镇的社交叙事量)难以定义,导致筛选只能选择性应用。改进方向:发展基于置换检验或反事实市场的通用'行为性'判据。
未来方向
作者方向:(1)最强检验仍是开放问题——在目标模拟的原始模型上跑代理以命中其发表的宏观数字,而非仅在形式上转移;(2)把分类法延伸到论文未覆盖的设计(如显式推荐器排序算法如何扫 $\lambda$ 旋钮已有原型Figure 3,但真实推荐系统的反馈回路未建模);(3)将代理拟合作为测量仪器推广——论文已演示Phillips曲线源自单一劳动顺周期系数、De Marzo $N_c$ 是感知分辨率 $\beta_{eff}(N)$ 穿越1、Williams流行病来自饱和社会响应、AgentSociety极化源自衰减记忆核,可系统化为'宏观定律的微观归因协议'。基于成果可延伸:(1)在代理社会上做原本昂贵的研究,如 $N$ 从20到3200的有限尺寸标度、干预实验与反事实政策模拟,成本近零;(2)把perception_floors做成发布前自动化审计工具:LLM模拟论文可报告其单元与预测地板,方便社区复检;(3)跨模型曲率(Jensen偏差从 $10^{-4}$ 到0.018、膝点从 $10^5$ 到140)可作为模型卡的新维度——'该模型在异质感知下的可粗粒化性';(4)与可微ABM(AgentTorch)结合,用代理的可微性做梯度政策优化;(5)对gpt-4o-mini这类失败案例做机理研究,检验是否是能力(指令跟随)还是架构(注意力稀释)所致。
复现评估
复现条件极为友好,这是本文的显著优点。代码、运行器与缓存决策轨迹全部开源在 github.com/YehudaItkin/poor-mans-agentic-modeling,配套系统综述与标度工具箱存档于Zenodo,预注册包带每文件SHA-256哈希存于外部时间戳DOI。由于所有LLM决策缓存到磁盘,种子化结果确定性复现,LLM实验可零成本重跑;全程引出花费仅几美元DeepSeek(主实验$0.44与$0.67两次付费运行),不需要GPU集群——整个卖点就是笔记本可跑任意 $N$。方法自包含:NumPy重实现的EconAgent市场可独立验证,classify_cell与perception_floors原语先在Minority Game与网络流行病这类有精确解的系统上认证。潜在难度在于:需要DeepSeek(或等价)API密钥以补充缓存外的引出;跨模型检验需要6-13个模型的访问权限;部分结果(如TwinMarket边界案例)依赖第三方实现的可用性。综合评估:对有基本Python与统计物理背景的研究者,复现核心EconAgent流水线约数天工作量,属高可复现论文。
论文图表