DarkForest:用受控通信让多智能体 LLM「少说多做」 DarkForest: Less Talk, Higher Accuracy for Multi-Agent LLMs
借鉴不完全信息博弈论,把多 agent 协调重写为「独立生成 + 结构化信念 + 受控暴露」,在六个推理基准上以最高 6.5 倍更少 token 达到 SOTA。
前置知识
Self-Consistency / 多数投票
对同一 prompt 用同一 LLM 采样多条链,最终取出现频次最高的答案。它假设多条 trace 独立同分布,把所有一致视作同等的证据,因此一个被多数模型反复犯的错也会被放大。
DarkForest 的实验里 Self-Consistency 是 MATH/MMLU-Pro 的最强 baseline,理解它何时失败、被相关性污染,才能体会 DarkForest 为什么把投票重塑为「带校准权重的证据聚合」。
LLM 多 agent 协作方法族(Debate / MoA / GoA / ReConcile)
通过让多个 LLM 互相阅读对方原始推理轨迹,以多轮对话、层级聚合或图结构路由来改进答案。代表方法 Debate(多轮互相说服)、ReConcile(置信度加权投票)、MoA(层级聚合)、GoA(图结构路由)。
这些方法正是 DarkForest 想替代的对象;它们的失败模式(原始 trace 传染错误、token 爆炸)是论文核心痛点,只有先了解这些 baseline 才能理解论文提出的受控通信思想。
不完全信息博弈(Harsanyi / Aumann)
博弈论中处理「参与者拥有私有信号、彼此类型不可直接观察」的框架。Harsanyi 把不完全信息建模为自然先抽取私有类型再玩游戏,Aumann 给出贝叶斯共识定义。核心洞见:在不确定+代价高环境下,通信应被当作信息暴露政策来管理。
整篇论文的方法论骨架(把 agent 输出视作私有信号、协调器收到的是经政策过滤后的证据、对代理间不可见但可能相关打折 delta_i)直接来自这一框架,不懂这套语言就读不出论文 Appendix A 的形式化。
贝叶斯/后验式证据聚合
把多个独立观测的似然相乘(或对数相加)再归一化得到后验分布。当证据权重不同(有些观测者更可靠)或在 precision 上有差异时,会用加权或变精度权重,仍保持归一化形式以可比。
DarkForest 的评分 s(z)=R_pi sum(alpha_i rho_i delta_i phi(c_i)) 本质就是类对数线性证据加权和,归一化后再 argmax 选 top 候选;理解这一形式才能看清为什么它和 Self-Cons 不同。
Laplace Smoothing / 离线校准
估计离散事件经验概率时,在分子分母上加 1 避免 0/1 极端值,如 alpha_i=(n_correct+1)/(n_valid+2)。样本量小或事件稀疏时很有用,可看作贝叶斯视角下的对称先验。
论文里 agent reliability alpha_i、support pattern reliability R_pi 都通过 closed-form 校准从 held-out 估计,不学任何参数;这决定 DarkForest 是放回式静态集成而非在线学习方法。
Token 经济性与推理成本
LLM 服务成本与生成 input+output token 数大致线性。多 agent 系统若让 N 个 agent 都把对方 trace 放进 prompt,token 以 O(N*L) 增长,每次新 round 再叠加;所谓质量提升必须扣除 5-30 倍的成本。
论文 Figure 1/3/4/5/6 全部在论证不降低准确率的同时把 token 量降到 baseline 的 1/3-1/6,这是 DarkForest 核心卖点之一。
研究动机
现有 multi-agent LLM 协调方法(以 Debate、ReConcile、MoA、GoA 为代表)有两个互耦合的痛点。第一是错误传播:当 agent 把对方原始 trace 或最终回答直接喂进自己 prompt 时,一个早期但能自圆其说的中间错解会被后续 agent 模仿、放大,最终得到高置信度的错答。第二是通信开销:在 MATH 上 GoA-mean 用 13.8k tokens/sample、Self-Consistency 11.8k、MoA 8.6k、GoA-max 7.6k,其中相当部分是复制粘贴别人的 reasoning。论文 Figure 1 揭示 3 个 agent 独立查询时至少一个给出正确答案的候选可达率为 75.2%,但 GoA-mean/MoA/Self-Cons 最终准确率只有 67.0-71.8%,Debate 仅 57.4%——大量正确证据被协调阶段丢掉或覆盖。叠加成本/质量差,作者提出核心设问:真正的问题不是「agent 之间要怎么聊更多」,而是「应该让哪些信息跨过 agent 边界」。
本文的目标是论文想设计一种以最少跨 agent 通信换最高准确率的协调框架,目标拆成三点:测试时保持 agent 候选生成独立(互不见);设计 calibrated belief state 显式编码「谁支持哪个候选、支持多强、他们之间可不可信」;让一个 final coordinator 只看 policy-permitted 的紧凑证据,配一个 deterministic guardrail 防止强证据候选被错误覆盖。成功度量:在 6 个推理任务(数学、代码、通用、科学、金融、法律)上达到最高或近最高质量,token 相对通信密集型 baseline 降低数倍。
与已有工作不同的是,切入角度来自不完全信息博弈论:多 agent 协调被类比为 type 不可见的人在私有信号上聚合。文中引 Harsanyi(1995)——在不确定、不信任、通信昂贵、代价大的环境下,agents 不该比为达成可靠协调所必需的暴露更多。multi-agent LLM 系统的「共享完整 trace」被重新解读为过度暴露,DarkForest 用 parse → cluster → calibrated belief → controlled disclosure → narrow guardrail 五步实现少说多做。与 Debate/ReConcile 用更多 LLM 调用弥补噪声、Self-Consistency 用投票假设独立的思路都截然不同:它既不强制互看,也不把 agreement 当无权重投票,而是重塑为带 4 个校准项的支持证据,再用 1 次 coordinator + 0 次额外 LLM 的 guardrail 完成决策。
核心方法
方法直觉:把多个 LLM agent 的输出当成对同一问题的私有信号,与其塞进对方 context,不如交给聚合器转成后验式分布,压缩成 fixed-schema 摘要给 final coordinator 做一次回答,最后用规则 guardrail 在 belief 强烈冲突时覆盖 coordinator。六步:独立候选生成、解析与规范化、候选聚类 $C_z=(z, S_z, \pi_z)$、校准信念 $s(z) = R_{\pi_z} \sum \alpha_i \rho_i \delta_i \phi(c_i)$、softmax 为 $P(z \mid O)$、受控暴露(coordinator 只看 belief summary)、coordinator+guardrail(Trusted 三条件 $|S_{z^*}|\geq k$、$P(z^* \mid O) \geq \tau_p$、$\Delta \geq \tau_m$)。整个 pipeline 只调 $4n+1$ 次 LLM,guardrail 完全 deterministic;$\alpha_i$ 等校准参数全来自 50-150 held-out 样本的离线 Laplace 估计,不修改模型、不在线学习。
与已有方法的本质区别有三点。第一,把 agreement 从无权重投票改为四维校准证据:$\alpha_i$(历史上这个 agent 有多准)、$R_\pi$(历史上这一组 agents 同时支持同一答案有多准,这是与 Self-Cons/MoA 的根本差别——它们不区分谁同意谁)、$\rho_i$(parse 质量)、$\delta_i$(独立性折扣)。第二,把 confidence $c_i$ 不是判决票而是用 $\phi(c_i) = 0.5 + c_i$ 作 bounded affine 调制(范围 0.5-1.5),低置信仍贡献证据,高置信只小幅加成,避免假装自信的 agent 带偏全局。第三,communication 被显式建模为 policy-controlled disclosure $D_\Omega: (O,B) \mapsto E$,可关闭(只暴露 belief summary)、加 reasoning summary、或全开 raw trace——Table 8 验证暴露越多并不更好,反而下降 3.3 个绝对点;coordinator 不被信任,必须配 deterministic guardrail 才能保证强证据候选不被语言模型凭说辞丢弃。
方法步骤详情
六步:(1)独立生成——3 agent $m_1,\dots,m_3$ 各自 $r_i \sim m_i(x)$,互不可见。(2)解析——任务特定 parser $P$ 将 $r_i$ 转成 $o_i=(a_i,z_i,c_i,v_i,q_i)$;$v_i=0$ 丢弃。(3)候选聚类——按 canonical $z$ 构造 $C_z=(z,S_z,\pi_z)$。(4)校准信念——$s(z) = R_{\pi_z} \sum \alpha_i \rho_i \delta_i \phi(c_i)$,softmax 为 $P(z \mid O)$;$\alpha_i$ 用 Laplace $(n+1)/(n+2)$ 离线估,$\phi(c_i)=0.5+c_i$,$\delta_i \leq 1$ 折损高相关。(5)受控暴露——把 (candidates、posterior、margin、top-2 ids) 写成 belief summary 给 coordinator。(6)协调+guardrail——coordinator 一次 $r_{coord} \sim m_{coord}(x,E)$;Trusted($z^*$) 三条件满足则覆盖 $\hat{z}_{coord}$。
技术新颖性
新颖性四点。第一,把博弈论信息暴露政策正式映射到多 agent LLM 协调(Appendix A 用 $\theta_i = (r_i^*, b_i, \kappa_i)$ 形式化 agent 的不可观测可靠性、置信偏差、相互依赖)。第二,显式 support-pattern reliability $R_\pi$:同一 cluster 不只是几票,而按「由哪一组 agents 投出」再加权,这是对「投票=独立证据」假设的最直接证伪——Table 6 显示仅做 agent-level 校准的 Weighted Vote 在 MMLU-Pro 比 Full DarkForest 低 2.0 点。第三,narrow deterministic guardrail:不调 LLM、用三条规则决定是否覆盖 coordinator;Table 2 显示在 MATH/LegalBench 上分别贡献 1.40/2.40 绝对点,token 增长为 0。第四,calibration-orchestrator 解耦:$\alpha_i$ 等全部离线冻结,在 line 推理只做 lookup,与 MoA/GoA 形成鲜明对比,支撑 Figure 3 token 降低 3.1-6.5 倍。
实验结果
6 benchmark 对 7 baseline 五发现:(1)MATH 76.80% exact match,比 Self-Cons 71.80% 高 5.00 绝对点、比 GoA-mean 71.40% 高 5.40 点,强过 Debate 57.40% 和 ReConcile 27.20%(2)MMLU-Pro 58.38% 比 Debate 高 2.52 点,比 Self-Cons/Refine/ReConcile/GoA-mean/max/MoA 全部更高。(3)FinQA 执行 15.67% 与 GoA-mean 16.00% 几乎打平,程序准确率 11.33% 是全场最佳(比 GoA-mean 8.67% 高 2.66 点)。(4)LegalBench 68.00% 与 ReConcile 69.00% 仅差 1.00 点。(5)HumanEval 84.00% 与 MoA 持平,比 GoA-max 86.00% 低 2.00 点,但 DarkForest 仅 1.5k tokens/sample。Token(图 3)相对 GoA-mean 降幅 65.9%-78.2%。Ablation(Table 6 + Figure 7)显示 calibration 占大头(MATH 5.6 绝对点)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| MATH (数学竞赛题, exact match) | Exact match | 76.80 | Self-Cons 71.80;GoA-mean 71.40;MoA 67.00;Debate 57.40 | 比最强 baseline 高 +5.00 绝对点(约 +7.0% 相对) |
| HumanEval (代码生成, Pass@1) | Pass@1 | 84.00 | GoA-max 86.00;MoA 84.00;GoA-mean 80.00;Refine 70.00 | 并列 MoA 最高,比 GoA-max 低 2.00 点但 token 仅其 1/4.8 |
| MMLU-Pro (多学科知识, accuracy) | Accuracy | 58.38 | MoA 53.38;Self-Cons 53.00;Refine 52.62;ReConcile 45.71 | 比 Debate 高 +2.52,比所有非 Self-Cons baseline 高 >=+5 绝对点 |
| GPQA (graduate 级科学 QA) | Accuracy | 39.90 | Self-Cons 40.40;MoA 35.86;Debate 35.86;GoA-mean 34.85 | 差 Self-Cons 0.50 点,但比 MoA/Debate/GoA-mean 高 4-5 点 |
| FinQA (金融 QA) | Execution & Program accuracy | 15.67 / 11.33 | GoA-mean 16.00 / 8.67;Refine 8.67 / 3.33;ReConcile 4.33 / 1.33 | Program accuracy 全场最高(+2.66),execution 仅低 GoA-mean 0.33 |
| LegalBench (法律推理) | Exact match | 68.00 | ReConcile 69.00;Self-Cons 65.00;Refine 60.80;MoA 53.80 | 差 ReConcile 仅 1.00 点,比 Self-Cons/Refine/MoA 高 3-14 点 |
局限与改进
承认+独立观察四点。(1)HumanEval 84.00% 比 GoA-max 86.00% 低 2.00 绝对点,作者解释为代码生成需保留 candidate program 细节但未进一步展开——canonicalization 在 HumanEval 上可能过强,把语法不同但都通过测试的程序聚为一类,grader 只接收一个 answer。(2)FinQA execution 没拿第一(15.67% vs 16.00%),reasoning summary 不含中间公式可能损失算术复用。(3)offline calibration 数据依赖,每 benchmark 需 50-150 held-out 样本,参数不在线更新,测试分布 drift 时校准值显著过期;论文没给 distribution shift 负面 case。(4)guardrail wrong override rate 非零:Table 9 显示 MATH 3.00-3.20%、LegalBench 0.40-2.40% 是错覆盖——guardrail 基于 belief posterior 不感知 task type,可能在「coordinator 长链思考答对但 belief 太散」时强行改成错答。
独立分析的弱点
独立四点弱点。(1)calibration 完全 offline 是双刃剑:参数在 50-150 样本估算,太少时 Laplace 退化成粗粒度(alpha_i → 0.5 偏置),罕见题型四个校准项都失效;改进方向是引入 Bayesian hierarchical prior 或自校准 alpha_i 方差表征,以及在线 EM 估 delta_i。(2)coordinator 单次 LLM 无 verify:MATH 去掉 guardrail 后掉 1.40 点说明 coordinator 单独跑约有 2%「好证据被丢」。(3)disclosure 只有 3 个粒度且默认最严;改进方向在 Algorithm 1 第 18 行后插 policy selector 基于 Uncertain(O) 选 Omega ∈ {strict, moderate, permissive}。(4)HumanEval/FinQA 需「程序细节+中间数值」任务上证据压缩过度:parser 只输出 code body 或最终数字;改进方向是为 code 任务单独设计保留 candidate program 全文、但暴露时只对 coordinator 显示 top-k 高置信候选。
未来方向
四方向。(1)作者希望探索 disclosure policy 自适应选择及更大 agent pool(>5)上的 scaling experiment(附录 D.6 在 FinQA 上 3->5 backbone,execution acc 从 15.67 升到 19.33,token 仅 4.5k->5.4k),进一步是 N=10+ 异构 agent 池是否仍线性收益。(2)基于 Appendix A 形式化,理论上可证明:在 agent reliability 满足 Fano-inequality 之类差分条件下 DarkForest decision rule 收敛到 Bayes-optimal,以及 guardrail false-override 上界。(3)可替代 Guardrail:用 small LLM-as-judge(如 Qwen2.5-Coder 7B)替换/补充 deterministic rule,保持低额外 token。(4)把 disclosure 推广到多模态:目前 P(.) task-specific,未来统一到 observation schema + JSON 序列化,让多模态 agents(图像、表格、检索文档)的私有信号走相同 belief pipeline。
复现评估
开源:代码 https://github.com/PearLoveTana/DarkForest_,提供 run scripts、calibration、evaluation harness;附录 B 详列 backbones 与 serving 设置。数据:6 benchmark 用公开 split,MATH/HumanEval/MMLU-Pro/GPQA 用 GoA-aligned,FinQA text-only 限制 300 测试 + 100 校准,LegalBench 在 154 个 task 上 stratified-sample 500 测试 + 100 校准。算力:全部 vLLM bf16,每张 H100 放一个 7B/8B 模型(单卡 TP=1);按 3-agent+1-coordinator+3-backbones 估一轮约需 4 张 H100(可串行复用)。难度中等偏上,Table 9 显示 tau_p 从 0.66 涨到 0.80 让 LegalBench 掉 1.40 点。已知不友好:没给 Wall-clock latency;没给 hyperparameter sensitivity 曲线;FinQA text-only 与原始 SOTA 不完全可比。
论文图表
上图柱状图展示 6 个 baseline(Debate、Self-Cons、Refine、ReConcile、GoA-mean、GoA-max)在 MATH 上每个样本消耗的总 token 数(13.8k/11.8k/8.6k/7.6k 等),以及 DarkForest 的 3.7k;下图柱状为各方法的 final accuracy(57.4-71.8),虚线代表候选可达率 75.2%——即至少有一个独立 agent 答对的样本比例。
这张图是整篇论文 motivation 的核心:用一个具体数据集(MATH)显示出 candidate 已经存在但被协调阶段丢弃或覆盖的差距,所有 baseline 都在 75.2% 这条虚线之下,从而把论证从「要更多通信」反转为「要控制通信」。
与主表 Table 2 完全一致,只是 Appendix D.2 单独给出,无 Coordinator 76.80/67.20、w/o Guardrail 75.40/65.60、Full 76.80/68.00。
Appendix 单独再放一次是为读者在翻 Appendix D 时不需要跳回主文;它和 Table 2 是同一证据的不同入口。