面向大模型持续改进的经验链 Chain-of-Experience for Continual LLM Improvement
让LLM在测试时通过迭代反馈积累经验,无需训练即可持续提升
前置知识
测试时计算(Test-time Compute)
指模型部署后不改参数、仅靠推理阶段增加计算来提升表现的范式,包括思维链、多数投票、树搜索、自我反思等。本文的 CoE 属于此范畴,但强调经验在同一任务内跨轮次累积复用,而非每轮独立采样后即弃。
CoE 的定位、基线选择(ICL/DC/ACE、高低推理档)与成本效率对比全部围绕测试时计算展开,不理解这一概念就无法理解论文的对比框架。
思维链与 Chain-of-X 方法
CoT 通过提示模型逐步推理提升数学、常识与符号任务表现,并衍生出对比 CoT、知识链、思维树(ToT)等变体。它们都只在单次生成内组织推理过程,不保留跨尝试的信息。
论文标题'经验链'是对'思维链'家族的直接延伸:从链式思考升级为链式经验迭代,理解这一脉络才能体会其差异化定位。
自我反思与 Self-Refine/Reflexion
让模型对自己的输出进行批评和修正:Self-Refine 在单一上下文内自评自改,Reflexion 引入代码执行结果等外部信号辅助迭代。本文将这类方法视为 CoE 框架下'模型反馈'通道的具体实例。
CoE 的自反馈设置直接继承这一传统,实验结论也与之对照,明确该脉络有助于理解反馈类型的来源与局限。
Dynamic CheatSheet 与 ACE(跨任务经验记忆)
维护一份持续更新的外部记忆,从历史已解问题中蒸馏可复用策略,再为新问题检索相关条目注入上下文。本文实测其在现代强推理模型上增益不稳定,平均表现甚至低于无反馈基线。
它们是 CoE 的核心基线;论文'完整轨迹优于压缩记忆'的关键结论正建立在与这类方法的正面对比之上。
皮尔逊相关系数
衡量两个变量线性相关程度的统计量,取值 $[-1,1]$,越接近 1 正相关越强。论文用它度量基座能力与改进幅度 $\Delta_{\mathcal{M}}=(S_{max}-S_{base})/(1-S_{base})$ 之间的关联强度。
Findings 3 的核心结论(越强的模型越能从经验中学习)完全由 r 值支撑,如 LiveBench (Code) 上 r=0.97,读懂它才能评估证据强度。
多数投票与选择性多数投票 SelMV
对多次采样得到的答案取众数以提升准确率;SelMV-n 只在前 n 个有效尝试内投票。论文用它证明:即使反馈信号完全错误,合理的聚合策略也能稳住甚至提升表现。
它是虚假反馈鲁棒性实验的关键工具,理解它才能读懂 Table 2 中'错误反馈 + SelMV 反超模型反馈'的意外结果。
研究动机
传统 LLM 一旦训练完成便以固定状态部署,每次推理都被当作孤立事件:模型无法利用求解过程中蕴含的反馈信息,'做过的题'不会让'下一题'变得更容易。已有测试时方法各有缺陷——多数投票、思维树等搜索策略虽然并行探索多个候选,但'经验'只是临时产物,聚合出最终答案后即被丢弃;Self-Refine、Reflexion 等自我精炼方法虽有迭代,但经验碎片化、仅在单一上下文内浅层使用;Dynamic CheatSheet(DC)与 Agentic Context Engineering(ACE)试图跨任务沉淀可复用策略,论文实测其在强推理模型上增益并不可靠:六个基准平均下来 ICL 只有 62.1%、ACE 64.0%、DC 62.7%,反而都低于朴素的无反馈基线 66.8%。也就是说,现有'利用经验'的方法在强推理模型时代不仅没赚到,还可能倒赔。
本文的目标是论文想系统回答一个问题:LLM 能否在测试时通过迭代交互与反馈,把整个求解历史当作经验来积累,从而超越零样本推理形成持续改进回路?为此它提出统一框架 Chain-of-Experience(CoE),将单轮问答扩展为序列决策过程,并在数学(AIME 2025、OmniMath)、编码(LiveCodeBench V6、LiveBench Code)、知识(EvaLearn、GPQA Diamond)三类任务共六个基准上,用 GPT-5、GPT-5 mini、o4-mini、o3、o3-mini、Gemini-2.5 Pro、Claude-4.5 Sonnet 等八个最新强推理模型(每项实验重复 3 次取均值与标准差),系统比较四种反馈类型在性能、API 成本、token 效率、改进能力与鲁棒性五个维度的表现。
与已有工作不同的是,独特之处有三:其一,首次把模型的完整求解历史整体定义为'经验',用统一的序列决策形式化 $a_t \sim P(a_t|Q,e_0,\ldots,e_{t-1})$ 罩住无反馈、执行器、模型自评、正确性四类异质信号,而不是像前人那样各自孤立地研究某一种迭代循环;其二,评估维度超越准确率,同时考察 API 成本、每 token 精度和'改进能力',并首次刻画'基座越强、学得越快'的经验缩放规律(任务级平均 Pearson r 约 0.5);其三,聚焦同一任务内的经验积累,与 DC/ACE 的跨任务记忆路线正面对照,从而能干净地回答'完整轨迹与压缩摘要哪个更值钱'这一此前无人系统验证的问题。
核心方法
直觉上,人做题靠的是每次对错带来的'手感'修正,而非孤立作答。CoE 把这一点形式化:在传统 $a \sim P(A|Q)$ 之上引入环境反馈变量,反馈 $f \sim P'(F|Q,A)$ 可来自代码执行环境 $\mathcal{E}$、模型自身的内心世界,甚至真实世界。第 $t$ 步的动作由全部历史经验生成:$$a_t \sim P(a_t \mid Q, e_0, e_1, \ldots, e_{t-1}), \quad e_i = (a_i, f_i)$$即每一步答案都以前面所有'尝试-反馈'对为条件。实现上,模型 $\mathcal{M}$ 与环境循环交互最多 20 轮:模型生成答案,环境按反馈类型回传信号,新的经验对拼入上下文驱动下一轮。整体在 6 个基准、8 个强推理模型上评估,每种设置重复 3 次,同时记录准确率与 API/token 成本,并设置 ICL/DC/ACE 与高低推理档四类基线对照。
核心创新是'反馈谱系':按信号从隐式到显式把环境响应分为四级——无反馈 $f_i=\emptyset$,改进只能靠纯反思;执行器反馈 $f_i \sim \mathcal{E}(Q,a_i)$,返回执行轨迹、报错与测试结果;模型反馈 $f_i=\mathcal{M}_{fb}(Q,a_i)$,由批评模型给出文字批评或偏好分,无需外部环境;正确性反馈 $f_i=\mathbb{1}\{a_i \text{正确}\}$,二值真值信号,作为现实中难得的上界参照。与已有方法的本质区别:DC/ACE 把经验压缩成摘要条目跨任务复用,Reflexion 只在单上下文浅层迭代,而 CoE 保留完整'尝试-反馈'轨迹在同一任务内滚动。实验证明激进的压缩会丢掉关键中间推理——纯模型反馈在 AIME 2025 达 60.0%,加 DC 反而掉到 50.0%。
方法步骤详情
流程五步。第一步初始化:对问题 $Q$ 零样本生成首个答案 $a_0$,记经验 $e_0=(a_0,f_0)$。第二步取反馈:执行器反馈运行代码拿报错与测试结果,模型反馈调用批评模型 $\mathcal{M}_{fb}$,正确性反馈对照真值 $f_i=\mathbb{1}\{a_i正确\}$,无反馈则 $f_i=\emptyset$。第三步更新生成:把全部历史 $(a_i,f_i)$ 拼入上下文,按 $a_t \sim P(a_t|Q,e_0,\ldots,e_{t-1})$ 采样下一答案,最多 20 轮,逐轮记录正确率与成本。第四步基线对照:ICL/DC/ACE 取 $k \in [1,5,8,12,15,20]$ 个相关解构成上下文,另设高/低推理档。第五步分析:用 $\Delta_{\mathcal{M}}=(S_{max}-S_{base})/(1-S_{base})$ 量化改进能力并算 Pearson 相关;SelMV 在前 n 个有效尝试上投票;GPT-5 对 6630 个错变对自动归因(与人类 Kappa 76.8%)。
技术新颖性
新颖性体现在四个层面。形式化上,把测试时改进统一为带环境反馈的序列决策,使四类异质反馈可在同一坐标系下公平比较——此前工作(Self-Refine、Reflexion、DC、ACE)都只是这条谱系上的孤立点。实证上,首次给出'完整经验轨迹优于压缩记忆'的证据(DC/SimpleMem 在同任务内加入反而拖累:AIME 2025 上模型反馈 60.0% vs +DC 50.0% vs +SimpleMem 56.7%),挑战了'外部记忆越大越好'的直觉。概念上,提出并测量'改进能力'这一新指标,发现其与基座能力正相关(任务级平均 Pearson r 约 0.5,LiveBench Code 高达 r=0.97),即'从经验中学习'是随模型能力涌现的性质。经济性上,把 API 成本纳入主叙事,展示反馈驱动的 CoE 以约 19% 更低成本换来 5.6% 平均提升,单位 token 精度高于所有对照方法。
实验结果
核心结果五组。性能:自反馈使八模型在六基准平均 +5.6%,正确性/执行器反馈 +11.1%;编码两任务执行器反馈从 66.4% 升至 75.0%,OmniMath 上正确性 75.1% > 自反馈 67.1% > 无反馈 62.5%;基线 ICL/ACE/DC 仅 62.1%/64.0%/62.7%,均低于无反馈 66.8%,自反馈达 71.0%,最佳反馈 79.3%。成本:编码任务自反馈以 $70.7 达 73.4%(执行器 $81.6、75.0%),比无反馈省 20%;正确性反馈 108K tokens 达 84.6%,DC 花 11K 仅 74.7%。相关性:LiveBench Code r=0.97、LiveCodeBench r=0.83,平均 r 约 0.5,基座越强学得越快。鲁棒性与归因:虚假反馈平均只伤 AIME 7.6%、GPQA 2.6%(GPT-5 mini 仅降 2.5%,o4-mini 降 12.8%);6630 个错变对中 47.7% 由反馈驱动、编码 30.0% 源于规格召回;双反馈在 AIME 达 76.7%,超正确性 70.0% 与模型 60.0%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 六基准综合(数学/编码/知识) | 平均准确率 | 自反馈 71.0%,最佳反馈 79.3% | 无反馈 CoE 66.8%;ICL 62.1%、ACE 64.0%、DC 62.7% | 自反馈较无反馈 +4.2pt,较 ICL/ACE/DC +7~9pt;正确性/执行器反馈 +11.1% |
| AIME 2025(数学竞赛) | 准确率(token 预算内) | 正确性反馈 84.6%(108K tokens) | DC 74.7%(11K tokens);无反馈 CoE 74.1%(107K tokens) | 约 +10pt,且每 token 精度显著更高 |
| LiveBench (Code) / LiveCodeBench V6(编码) | 公共测试通过率 | 执行器反馈平均 75.0%;Claude 4.5 Sonnet 双反馈 81.2% | 无反馈 66.4%;模型反馈 57.8% | +8.6pt(执行器);双反馈再 +3.1pt |
| OmniMath(高难数学) | 准确率 | 正确性反馈 75.1% | 自反馈 67.1%;无反馈 62.5% | +12.6pt(对比无反馈) |
| 编码任务 API 成本(LiveBench Code + LiveCodeBench) | API 花费(美元) | 自反馈 $70.7 达 73.4% 准确率 | 执行器反馈 $81.6 达 75.0%;无反馈更贵约 20% | 比执行器省 13.4% 调用、比无反馈省 20% 成本,精度仅让 1.6pt |
| GPQA Diamond(知识)+ 虚假反馈鲁棒性 | SelMV 聚合后最佳准确率 | SelMV + 错误反馈 82.8%(GPT-5 mini) | 模型反馈 79.4% | +0.9pt,错误信号下仍可反超 |
局限与改进
作者承认并经我补充的局限:正确性反馈依赖真值标签,现实中多数场景不可得,只能充当上界参照,真正可落地的只有自反馈与执行器反馈两条通道;自反馈质量高度依赖模型自评能力,Gemini 2.5 Pro 的自反馈反而产出更冗长、增益更小,说明该范式对模型有选择性;经验不跨任务持久,会话结束即弃,论文没有给出部署期持续学习的路径;双反馈并非普适增益,OmniMath 上 73.5% 反而略低于纯正确性反馈 74.5%,且会把最佳轮次推后、增加成本;实验限制在 20 轮迭代内且收益集中在早期,但全矩阵仍按多轮跑满,EvaLearn 单任务 API 花费高达 $325.3,开销对实用化不友好;另外改进归因完全交给 GPT-5 自动判读,虽有 76.8% 的 Kappa 一致性佐证,仍可能存在对'规格召回'类原因的系统性偏置。
独立分析的弱点
独立分析的弱点:第一,正确性反馈本质是测试集 oracle,论文 11.1% 的上界提升有'纸面收益'之嫌,改进方向是用弱监督验证器、部分单元测试或自洽性信号逼近;第二,自反馈不可靠时缺乏兜底机制,Gemini 2.5 Pro 的失败案例提示可引入校准后的置信度估计或专用 critique 模型,动态决定是否信任自评信号;第三,'完整轨迹优于压缩'的结论只在 20 轮、单任务内成立,长会话下上下文会爆炸,可研究层级式记忆——近期保留完整轨迹、远期压缩并配检索验证;第四,收益集中在早期迭代却仍跑满多轮,应设计基于边际增益的自适应早停;第五,跨任务经验完全被排除在主线之外,'跨任务沉淀 + 任务内完整轨迹'的混合架构与 DC/ACE 的互补性值得专门实验;第六,评测聚焦准确率与成本,未测延迟,而多轮串行交互对在线服务的响应时间代价不小。
未来方向
作者方向的延伸:附录已探索反馈强度梯度与更长迭代,正文动机中还提到以真实世界环境充当 $\mathcal{E}$,这是最诱人的延伸——把执行器换成搜索引擎、数据库或人类用户,让 CoE 走出考试式评测。基于成果可再走三条路:一是把测试时积累的经验蒸馏进参数,形成 test-time training 或经验回放式自我提升闭环,弥合'推理时学习'与'训练时学习'的鸿沟;二是学习反馈函数本身,用强化学习训练廉价可靠的 verifier,替代昂贵的 oracle 与不稳定的自评;三是机制层面追问'为什么基座越强越会利用反馈',把改进能力 $\Delta_{\mathcal{M}}$ 当作可优化的训练目标(例如 RL 直接奖励改进幅度),并与多智能体经验共享、SelMV 类聚合策略的自动化选择相结合。
复现评估
复现难度中等偏低、但预算要求高。方法本身极简:多轮提示加环境调用,无训练、无自定义模型。六个基准全部公开(AIME 2025、OmniMath、LiveCodeBench V6、LiveBench、EvaLearn、GPQA Diamond),模型为商用 API(GPT-5、GPT-5 mini、o4-mini、o3、o3-mini、Gemini-2.5 Pro、Claude-4.5 Sonnet),提示词配置在附录 A 与 K 有交代,每项实验重复 3 次报告均值方差,统计口径规范。但正文未见开源代码链接;实验规模庞大——每个设置 3 次重复、最多 20 轮迭代,EvaLearn 单任务无反馈就花费 $325.3,全矩阵复现估计需数千美元 API 预算;ICL/DC/ACE 的检索细节(k 值、嵌入模型)也需自行补齐。单人复现单块结论(如自反馈 vs 无反馈在 AIME 上)可行,完整复现全部表格则工程量不小。
论文图表