← 返回 2026-08-21

面向大模型持续改进的经验链 Chain-of-Experience for Continual LLM Improvement

Haoqin Tu, Yunhao Fang, Yizhong Wang, Cihang Xie, Shen Yan 📅 2026-08-18 👍 9 2026-08-26 18:30
反馈学习 大语言模型 测试时计算 自我改进

让LLM在测试时通过迭代反馈积累经验,无需训练即可持续提升

前置知识

测试时计算(Test-time Compute)

指模型部署后不改参数、仅靠推理阶段增加计算来提升表现的范式,包括思维链、多数投票、树搜索、自我反思等。本文的 CoE 属于此范畴,但强调经验在同一任务内跨轮次累积复用,而非每轮独立采样后即弃。

CoE 的定位、基线选择(ICL/DC/ACE、高低推理档)与成本效率对比全部围绕测试时计算展开,不理解这一概念就无法理解论文的对比框架。

思维链与 Chain-of-X 方法

CoT 通过提示模型逐步推理提升数学、常识与符号任务表现,并衍生出对比 CoT、知识链、思维树(ToT)等变体。它们都只在单次生成内组织推理过程,不保留跨尝试的信息。

论文标题'经验链'是对'思维链'家族的直接延伸:从链式思考升级为链式经验迭代,理解这一脉络才能体会其差异化定位。

自我反思与 Self-Refine/Reflexion

让模型对自己的输出进行批评和修正:Self-Refine 在单一上下文内自评自改,Reflexion 引入代码执行结果等外部信号辅助迭代。本文将这类方法视为 CoE 框架下'模型反馈'通道的具体实例。

CoE 的自反馈设置直接继承这一传统,实验结论也与之对照,明确该脉络有助于理解反馈类型的来源与局限。

Dynamic CheatSheet 与 ACE(跨任务经验记忆)

维护一份持续更新的外部记忆,从历史已解问题中蒸馏可复用策略,再为新问题检索相关条目注入上下文。本文实测其在现代强推理模型上增益不稳定,平均表现甚至低于无反馈基线。

它们是 CoE 的核心基线;论文'完整轨迹优于压缩记忆'的关键结论正建立在与这类方法的正面对比之上。

皮尔逊相关系数

衡量两个变量线性相关程度的统计量,取值 $[-1,1]$,越接近 1 正相关越强。论文用它度量基座能力与改进幅度 $\Delta_{\mathcal{M}}=(S_{max}-S_{base})/(1-S_{base})$ 之间的关联强度。

Findings 3 的核心结论(越强的模型越能从经验中学习)完全由 r 值支撑,如 LiveBench (Code) 上 r=0.97,读懂它才能评估证据强度。

多数投票与选择性多数投票 SelMV

对多次采样得到的答案取众数以提升准确率;SelMV-n 只在前 n 个有效尝试内投票。论文用它证明:即使反馈信号完全错误,合理的聚合策略也能稳住甚至提升表现。

它是虚假反馈鲁棒性实验的关键工具,理解它才能读懂 Table 2 中'错误反馈 + SelMV 反超模型反馈'的意外结果。

研究动机

传统 LLM 一旦训练完成便以固定状态部署,每次推理都被当作孤立事件:模型无法利用求解过程中蕴含的反馈信息,'做过的题'不会让'下一题'变得更容易。已有测试时方法各有缺陷——多数投票、思维树等搜索策略虽然并行探索多个候选,但'经验'只是临时产物,聚合出最终答案后即被丢弃;Self-Refine、Reflexion 等自我精炼方法虽有迭代,但经验碎片化、仅在单一上下文内浅层使用;Dynamic CheatSheet(DC)与 Agentic Context Engineering(ACE)试图跨任务沉淀可复用策略,论文实测其在强推理模型上增益并不可靠:六个基准平均下来 ICL 只有 62.1%、ACE 64.0%、DC 62.7%,反而都低于朴素的无反馈基线 66.8%。也就是说,现有'利用经验'的方法在强推理模型时代不仅没赚到,还可能倒赔。

本文的目标是论文想系统回答一个问题:LLM 能否在测试时通过迭代交互与反馈,把整个求解历史当作经验来积累,从而超越零样本推理形成持续改进回路?为此它提出统一框架 Chain-of-Experience(CoE),将单轮问答扩展为序列决策过程,并在数学(AIME 2025、OmniMath)、编码(LiveCodeBench V6、LiveBench Code)、知识(EvaLearn、GPQA Diamond)三类任务共六个基准上,用 GPT-5、GPT-5 mini、o4-mini、o3、o3-mini、Gemini-2.5 Pro、Claude-4.5 Sonnet 等八个最新强推理模型(每项实验重复 3 次取均值与标准差),系统比较四种反馈类型在性能、API 成本、token 效率、改进能力与鲁棒性五个维度的表现。

与已有工作不同的是,独特之处有三:其一,首次把模型的完整求解历史整体定义为'经验',用统一的序列决策形式化 $a_t \sim P(a_t|Q,e_0,\ldots,e_{t-1})$ 罩住无反馈、执行器、模型自评、正确性四类异质信号,而不是像前人那样各自孤立地研究某一种迭代循环;其二,评估维度超越准确率,同时考察 API 成本、每 token 精度和'改进能力',并首次刻画'基座越强、学得越快'的经验缩放规律(任务级平均 Pearson r 约 0.5);其三,聚焦同一任务内的经验积累,与 DC/ACE 的跨任务记忆路线正面对照,从而能干净地回答'完整轨迹与压缩摘要哪个更值钱'这一此前无人系统验证的问题。

核心方法

直觉上,人做题靠的是每次对错带来的'手感'修正,而非孤立作答。CoE 把这一点形式化:在传统 $a \sim P(A|Q)$ 之上引入环境反馈变量,反馈 $f \sim P'(F|Q,A)$ 可来自代码执行环境 $\mathcal{E}$、模型自身的内心世界,甚至真实世界。第 $t$ 步的动作由全部历史经验生成:$$a_t \sim P(a_t \mid Q, e_0, e_1, \ldots, e_{t-1}), \quad e_i = (a_i, f_i)$$即每一步答案都以前面所有'尝试-反馈'对为条件。实现上,模型 $\mathcal{M}$ 与环境循环交互最多 20 轮:模型生成答案,环境按反馈类型回传信号,新的经验对拼入上下文驱动下一轮。整体在 6 个基准、8 个强推理模型上评估,每种设置重复 3 次,同时记录准确率与 API/token 成本,并设置 ICL/DC/ACE 与高低推理档四类基线对照。

核心创新是'反馈谱系':按信号从隐式到显式把环境响应分为四级——无反馈 $f_i=\emptyset$,改进只能靠纯反思;执行器反馈 $f_i \sim \mathcal{E}(Q,a_i)$,返回执行轨迹、报错与测试结果;模型反馈 $f_i=\mathcal{M}_{fb}(Q,a_i)$,由批评模型给出文字批评或偏好分,无需外部环境;正确性反馈 $f_i=\mathbb{1}\{a_i \text{正确}\}$,二值真值信号,作为现实中难得的上界参照。与已有方法的本质区别:DC/ACE 把经验压缩成摘要条目跨任务复用,Reflexion 只在单上下文浅层迭代,而 CoE 保留完整'尝试-反馈'轨迹在同一任务内滚动。实验证明激进的压缩会丢掉关键中间推理——纯模型反馈在 AIME 2025 达 60.0%,加 DC 反而掉到 50.0%。

方法步骤详情

流程五步。第一步初始化:对问题 $Q$ 零样本生成首个答案 $a_0$,记经验 $e_0=(a_0,f_0)$。第二步取反馈:执行器反馈运行代码拿报错与测试结果,模型反馈调用批评模型 $\mathcal{M}_{fb}$,正确性反馈对照真值 $f_i=\mathbb{1}\{a_i正确\}$,无反馈则 $f_i=\emptyset$。第三步更新生成:把全部历史 $(a_i,f_i)$ 拼入上下文,按 $a_t \sim P(a_t|Q,e_0,\ldots,e_{t-1})$ 采样下一答案,最多 20 轮,逐轮记录正确率与成本。第四步基线对照:ICL/DC/ACE 取 $k \in [1,5,8,12,15,20]$ 个相关解构成上下文,另设高/低推理档。第五步分析:用 $\Delta_{\mathcal{M}}=(S_{max}-S_{base})/(1-S_{base})$ 量化改进能力并算 Pearson 相关;SelMV 在前 n 个有效尝试上投票;GPT-5 对 6630 个错变对自动归因(与人类 Kappa 76.8%)。

技术新颖性

新颖性体现在四个层面。形式化上,把测试时改进统一为带环境反馈的序列决策,使四类异质反馈可在同一坐标系下公平比较——此前工作(Self-Refine、Reflexion、DC、ACE)都只是这条谱系上的孤立点。实证上,首次给出'完整经验轨迹优于压缩记忆'的证据(DC/SimpleMem 在同任务内加入反而拖累:AIME 2025 上模型反馈 60.0% vs +DC 50.0% vs +SimpleMem 56.7%),挑战了'外部记忆越大越好'的直觉。概念上,提出并测量'改进能力'这一新指标,发现其与基座能力正相关(任务级平均 Pearson r 约 0.5,LiveBench Code 高达 r=0.97),即'从经验中学习'是随模型能力涌现的性质。经济性上,把 API 成本纳入主叙事,展示反馈驱动的 CoE 以约 19% 更低成本换来 5.6% 平均提升,单位 token 精度高于所有对照方法。

An overview of our studies iterative improvement loop for LMs
Figure 2: An overview of our studies iterative improvement loop for LMs

实验结果

核心结果五组。性能:自反馈使八模型在六基准平均 +5.6%,正确性/执行器反馈 +11.1%;编码两任务执行器反馈从 66.4% 升至 75.0%,OmniMath 上正确性 75.1% > 自反馈 67.1% > 无反馈 62.5%;基线 ICL/ACE/DC 仅 62.1%/64.0%/62.7%,均低于无反馈 66.8%,自反馈达 71.0%,最佳反馈 79.3%。成本:编码任务自反馈以 $70.7 达 73.4%(执行器 $81.6、75.0%),比无反馈省 20%;正确性反馈 108K tokens 达 84.6%,DC 花 11K 仅 74.7%。相关性:LiveBench Code r=0.97、LiveCodeBench r=0.83,平均 r 约 0.5,基座越强学得越快。鲁棒性与归因:虚假反馈平均只伤 AIME 7.6%、GPQA 2.6%(GPT-5 mini 仅降 2.5%,o4-mini 降 12.8%);6630 个错变对中 47.7% 由反馈驱动、编码 30.0% 源于规格召回;双反馈在 AIME 达 76.7%,超正确性 70.0% 与模型 60.0%。

Dual feedback and principled experience selection results using Claude 4.5 Sonnet
Table 1: Dual feedback and principled experience selection results using Claude 4.5 Sonnet
The best performance over 20 iterations under constant correct or incorrect feedback (SelMV helps LLMs maintain performance)
Table 2: The best performance over 20 iterations under constant correct or incorrect feedback (SelMV helps LLMs maintain performance)
Summarized results on four benchmarks across math, code, and knowledge over four LLMs
Figure 1: Summarized results on four benchmarks across math, code, and knowledge over four LLMs
Results of five state-of-the-art LLMs on six benchmarks using different generation techniques
Figure 3: Results of five state-of-the-art LLMs on six benchmarks using different generation techniques
Total cost of each model over task completion vs. its best performance within 20 iterations
Figure 4: Total cost of each model over task completion vs. its best performance within 20 iterations
Zero-shot performance of models (Base Capacity) and the learning gain show positive Pearson correlations (r)
Figure 5: Zero-shot performance of models (Base Capacity) and the learning gain show positive Pearson correlations (r)
Percentages of different reasons for LLMs' improvement patterns from 6,630 incorrect to correct response pairs
Figure 6: Percentages of different reasons for LLMs' improvement patterns from 6,630 incorrect to correct response pairs
查看结构化数据
任务指标本文基线提升
六基准综合(数学/编码/知识) 平均准确率 自反馈 71.0%,最佳反馈 79.3% 无反馈 CoE 66.8%;ICL 62.1%、ACE 64.0%、DC 62.7% 自反馈较无反馈 +4.2pt,较 ICL/ACE/DC +7~9pt;正确性/执行器反馈 +11.1%
AIME 2025(数学竞赛) 准确率(token 预算内) 正确性反馈 84.6%(108K tokens) DC 74.7%(11K tokens);无反馈 CoE 74.1%(107K tokens) 约 +10pt,且每 token 精度显著更高
LiveBench (Code) / LiveCodeBench V6(编码) 公共测试通过率 执行器反馈平均 75.0%;Claude 4.5 Sonnet 双反馈 81.2% 无反馈 66.4%;模型反馈 57.8% +8.6pt(执行器);双反馈再 +3.1pt
OmniMath(高难数学) 准确率 正确性反馈 75.1% 自反馈 67.1%;无反馈 62.5% +12.6pt(对比无反馈)
编码任务 API 成本(LiveBench Code + LiveCodeBench) API 花费(美元) 自反馈 $70.7 达 73.4% 准确率 执行器反馈 $81.6 达 75.0%;无反馈更贵约 20% 比执行器省 13.4% 调用、比无反馈省 20% 成本,精度仅让 1.6pt
GPQA Diamond(知识)+ 虚假反馈鲁棒性 SelMV 聚合后最佳准确率 SelMV + 错误反馈 82.8%(GPT-5 mini) 模型反馈 79.4% +0.9pt,错误信号下仍可反超

局限与改进

作者承认并经我补充的局限:正确性反馈依赖真值标签,现实中多数场景不可得,只能充当上界参照,真正可落地的只有自反馈与执行器反馈两条通道;自反馈质量高度依赖模型自评能力,Gemini 2.5 Pro 的自反馈反而产出更冗长、增益更小,说明该范式对模型有选择性;经验不跨任务持久,会话结束即弃,论文没有给出部署期持续学习的路径;双反馈并非普适增益,OmniMath 上 73.5% 反而略低于纯正确性反馈 74.5%,且会把最佳轮次推后、增加成本;实验限制在 20 轮迭代内且收益集中在早期,但全矩阵仍按多轮跑满,EvaLearn 单任务 API 花费高达 $325.3,开销对实用化不友好;另外改进归因完全交给 GPT-5 自动判读,虽有 76.8% 的 Kappa 一致性佐证,仍可能存在对'规格召回'类原因的系统性偏置。

独立分析的弱点

独立分析的弱点:第一,正确性反馈本质是测试集 oracle,论文 11.1% 的上界提升有'纸面收益'之嫌,改进方向是用弱监督验证器、部分单元测试或自洽性信号逼近;第二,自反馈不可靠时缺乏兜底机制,Gemini 2.5 Pro 的失败案例提示可引入校准后的置信度估计或专用 critique 模型,动态决定是否信任自评信号;第三,'完整轨迹优于压缩'的结论只在 20 轮、单任务内成立,长会话下上下文会爆炸,可研究层级式记忆——近期保留完整轨迹、远期压缩并配检索验证;第四,收益集中在早期迭代却仍跑满多轮,应设计基于边际增益的自适应早停;第五,跨任务经验完全被排除在主线之外,'跨任务沉淀 + 任务内完整轨迹'的混合架构与 DC/ACE 的互补性值得专门实验;第六,评测聚焦准确率与成本,未测延迟,而多轮串行交互对在线服务的响应时间代价不小。

未来方向

作者方向的延伸:附录已探索反馈强度梯度与更长迭代,正文动机中还提到以真实世界环境充当 $\mathcal{E}$,这是最诱人的延伸——把执行器换成搜索引擎、数据库或人类用户,让 CoE 走出考试式评测。基于成果可再走三条路:一是把测试时积累的经验蒸馏进参数,形成 test-time training 或经验回放式自我提升闭环,弥合'推理时学习'与'训练时学习'的鸿沟;二是学习反馈函数本身,用强化学习训练廉价可靠的 verifier,替代昂贵的 oracle 与不稳定的自评;三是机制层面追问'为什么基座越强越会利用反馈',把改进能力 $\Delta_{\mathcal{M}}$ 当作可优化的训练目标(例如 RL 直接奖励改进幅度),并与多智能体经验共享、SelMV 类聚合策略的自动化选择相结合。

复现评估

复现难度中等偏低、但预算要求高。方法本身极简:多轮提示加环境调用,无训练、无自定义模型。六个基准全部公开(AIME 2025、OmniMath、LiveCodeBench V6、LiveBench、EvaLearn、GPQA Diamond),模型为商用 API(GPT-5、GPT-5 mini、o4-mini、o3、o3-mini、Gemini-2.5 Pro、Claude-4.5 Sonnet),提示词配置在附录 A 与 K 有交代,每项实验重复 3 次报告均值方差,统计口径规范。但正文未见开源代码链接;实验规模庞大——每个设置 3 次重复、最多 20 轮迭代,EvaLearn 单任务无反馈就花费 $325.3,全矩阵复现估计需数千美元 API 预算;ICL/DC/ACE 的检索细节(k 值、嵌入模型)也需自行补齐。单人复现单块结论(如自反馈 vs 无反馈在 AIME 上)可行,完整复现全部表格则工程量不小。