测试时的 AI4AI:通过脚手架实现强到弱的能力迁移 AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses
强模型构建推理时脚手架,让弱模型零训练下从0.49跃升至0.91。
前置知识
强到弱脚手架(Strong-to-Weak Scaffolding)
指强模型(builder)不修改弱模型(target)的任何参数,而是为其编写推理时的外部辅助结构:任务路由、提示模板、确定性求解器、few-shot 示例、校验环节与答案格式强制等。脚手架决定了弱模型如何接收输入、进行推理和输出答案,相当于把强模型对任务的理解「编译」成弱模型可重复执行的环境,与训练时蒸馏形成互补路线。
这是本文定义并系统研究的核心新设定,理解它才能区分本文与知识蒸馏、自动提示优化、agent 搜索等工作在问题形式上的本质不同。
心智理论(Theory-of-Mind, ToM)
推理他人心理状态的能力,包括追踪嵌套信念(如「A 认为 B 认为……」)、视角切换、隐藏信息判断与贝叶斯目标推断。代表性基准有 BigToM(判断角色是否观察到世界变化)、Hi-ToM(0-4 阶递归信念)、MMToM-QA(从行为轨迹做贝叶斯目标推断)、MuMA-ToM(多智能体信念与社会目标),对小型模型尤其困难。
论文全部实验都在这四个 ToM 基准上进行,理解任务结构——哪些部分可编译成规则、哪些必须真实推理——是读懂结果分析与残余错误讨论的前提。
知识蒸馏与 on-policy 蒸馏
传统强到弱能力迁移依赖训练:数据蒸馏让学生模型在教师生成的样本、理由和推理链上训练;on-policy 蒸馏让学生在自己生成的轨迹上接收教师的稠密反馈或奖励,减少训练与推理间的分布失配。两者都必须更新学生参数,成本高、每次能力升级都要重训。
本文的动机正是对照这一范式提出反问:能否完全不训练,仅在推理时通过 harness 就完成强到弱的能力迁移?理解蒸馏才能体会本文设定的互补价值。
认知负荷与确定性卸载
认知负荷理论(Sweller, 1988)认为表现下降可能源于任务呈现方式施加的负担而非能力不足。确定性卸载指把脆弱易错的推理步骤交给代码或规则执行(例如用 Python 精确判定「角色是否观察到事件」),只把无法编译成明确规则的部分留给模型,从而降低弱模型每道题上的认知负荷。论文用 determinism fraction(由代码/规则直接作答的题目比例)来定量衡量它。
这是论文解释增益来源的机制核心:确定性比例与最终准确率相关达 $r=0.72$,理解该概念才能明白为什么提升来自「结构外化」而非「让模型想得更多」。
McNemar 检验与归因分析
McNemar 检验用于配对分类结果的显著性比较:统计基线做错而脚手架做对(fixed)与基线做对而脚手架做错(broke)的题目数,构造 $\chi^2$ 统计量判断提升是否超出噪声。归因分析则对比使用与不使用某技术的两组运行的平均准确率差异,识别哪些设计真正与高性能相关,但技术常共现,结论是关联性而非严格因果。
论文用它们证明最佳脚手架的提升(修正 1717 题仅破坏 105 题)真实可靠,并据此区分「普及的可靠性地板技术」与「真正区分强弱的任务结构利用技术」。
研究动机
现有强到弱能力迁移几乎完全依赖训练时方法:数据蒸馏让学生在教师生成的样本与推理链上训练,on-policy 蒸馏在学生行动时给予稠密反馈,RLHF 通过偏好信号改写策略——它们都要更新弱模型参数,成本高且每次升级都需重训。而实际部署中,小模型很少被单独使用,而是嵌入带路由、工具调用、答案校验的 agent 流水线,但这类 harness 工程长期缺乏系统研究:我们不知道这些外部结构为何有效、何时稳定、哪些设计选择真正重要,也不知道多少提升来自真实的推理支持而非基准特定捷径,这使 harness 难以比较、复现和改进。此外,认知负荷理论提示:小模型失败未必是内部能力不足,也可能只是任务呈现方式施加了过重的认知负担——这意味着除了「把模型变强」,还存在「把任务变得容易被解决」这条被忽视的路线。
本文的目标是本文的目标是形式化并系统测量一种互补范式——推理时的强到弱脚手架:让强 builder 模型为参数完全冻结的弱 target 模型构造推理时辅助结构,考察能否在不更新任何权重的前提下显著提升其任务表现。具体设定为:四个 ToM 基准共 3900 题作为隐藏测试集,builder 只拿到 5%(195 题)验证集,在 agent 编码环境中迭代设计并精炼脚手架,最终导出的入口函数在隐藏测试集上评分。围绕这一设定,论文系统回答十个问题:效应量、跨运行稳定性、验证数据使用效率、builder 实际使用的脚手架技术、平台影响、target 依赖性、builder 推理努力的作用、增益的因果机制、认知负荷削减程度,以及残余失败模式。
与已有工作不同的是,本文的独特切入在于把蒸馏的方向完全倒转:能力不通过权重传递,而通过 harness 传递。builder 从头到尾看不到测试集,因此任何成功的脚手架都必须从 5% 验证切片中捕捉可复用的任务结构与技能,而非记忆逐题答案——这使该设定天然隔离出「可泛化的结构外化」这一能力。其次,现有自动 scaffold 工作(DSPy、ADAS、Meta-Harness 等)大多优化单一模型在每道题上的推理方式,本文则要求 builder 构造一个持久的推理时过程,供另一个更弱的模型跨隐藏样本执行,并首次系统隔离 builder 能力、推理努力、平台选择、验证预算、target 余量与任务可编译性六个因素如何共同决定 harness 质量。第三,它把评价问题从「模型多会解题」重构为「强模型多会构造让弱模型解题的条件」,为衡量 builder 能力提供了全新视角。
核心方法
直觉上,方法是让强模型把一次性的深度任务理解「编译」成弱模型可反复执行的结构化环境。技术路线上,builder 被置于现成 agent 编码 harness(Cursor、Claude Code 或 GPT Codex)中,初始工作区 $W_0=\{R, C_{demo}, V\}$ 含规则文件 $R$、target 调用示例 $C_{demo}$ 和 195 题验证集 $V$。脚手架形式完全开放:基准路由、提示模板、确定性求解器、few-shot 示例、校验或格式强制均可,唯一要求是导出可作用于未见样本的入口函数。builder 循环执行「读资源—提出或修改脚手架 $S_k$—验证集评估—诊断错误并回填工作区」,最终由人类评估者在隐藏测试集 $T$ 上运行 $\hat{Y}_T = f_{\hat{S}}(T; M_{tar})$。由于 $T$ 隐藏,builder 实际优化的是代理目标 $\hat{S} = \arg\max_{S \in \mathcal{S}_{build}} \mathrm{Acc}(S, M_{tar}; V)$,成功与否取决于验证切片提炼的结构能否迁移。
核心创新是把 harness 本身当作被优化的第一等对象,并由强模型全自动完成。与知识蒸馏的本质区别:蒸馏把教师能力写进学生权重,本文把教师对任务结构的洞察写进推理环境,target 参数完全冻结;迁移载体是可读、可审计、可版本管理的代码而非不可解释的梯度更新。与 DSPy、ADAS 等自动提示/agent 搜索的区别:那些工作优化同一个模型在单道题上的推理方式,本文要求 builder 构造供另一个更弱模型跨隐藏样本执行的持久推理时过程,因此脚手架必须捕捉可迁移的任务规律而非单例技巧。与人工设计 harness(如 UserHarness)的区别:全程无人类 ToM 知识注入,从而能纯粹测量强模型的自动结构发现能力。本质区别一句话:以往方法回答「如何让这个模型更强」,本文回答「强模型如何为弱模型构造让任务变容易的条件」。
方法步骤详情
算法 1 分六步:(1) 初始化工作区 $W_0=\{R, C_{demo}, V\}$,置空脚手架 $S_0=\emptyset$;(2) builder 读取规则与验证集,理解任务格式与调用方式;(3) 提出或修改脚手架 $S_k \leftarrow M_{build}(W_k)$;(4) 验证集评估 $\hat{Y}_k^V \leftarrow S_k(M_{tar}, V)$ 得准确率 $a_k$,每次评估计入有限预算;(5) 收集错误集 $\mathcal{E}_k=\{(x,y,\hat{y}) \in V: \hat{y} \neq y\}$,回填 $\{S_k, a_k, \mathcal{E}_k\}$ 进入下一轮;(6) 提交入口函数 $f_{\hat{S}}(x; M_{tar})$,人类评估者在 3900 题隐藏集上运行。实验矩阵:BigToM 1200 题、Hi-ToM 1200 题、MMToM-QA 600 题、MuMA-ToM 900 题;8 个 builder(含 Opus-4.7 低/中/高/超高四档推理努力)× 3 平台 × 3 次重复共 72 次运行;target 为 GPT-5.4-mini(主)与 Gemini-3.5-flash(对照)。
技术新颖性
技术新颖性体现在四点。第一,设定级创新:首次把「测试时强到弱迁移」形式化为独立研究问题,用隐藏测试集加 5% 验证的协议保证测量的是可泛化结构而非记忆。第二,测量级创新:提出 12 类技术分类法,对 72 次运行的脚手架代码逐一定期标注,并用 determinism fraction(代码/规则直接作答的题目比例)定量测认知负荷转移,发现其与准确率相关 $r=0.72$;还用配对 McNemar 检验和修正集合 Jaccard 重叠做因果性与互补性交叉验证。第三,反直觉发现:验证评估次数与最终性能几乎无关(Pearson $r=0.17$),而 builder 推理努力单调有效(Spearman $\rho=0.77$),说明有用的测试时计算是「假设形成的深度」而非「反馈查询的次数」;平台只是二阶条件因素(native 优势仅 +0.013,$p=0.484$)。第四,提出余量定律:提升幅度由 $1-\text{baseline}$ 刻画的可纠错误空间预测($r=0.75$),把「target 越强提升越小」升级为一般原则。
实验结果
按实验逐一分析:(1) 效应量:57 个 GPT-5.4-mini 脚手架运行宏平均 0.763,较基线 0.488 提升 +0.275,100% 超基线;最佳运行(GPT-5.5 + GPT Codex)达 0.912(+0.423,相对 86.7%),四基准全面超过无脚手架 GPT-5.4(0.619)与 GPT-OSS-120B;对人工参照 BigToM 1.00 超 UserHarness 0.95,但 Hi-ToM 0.80 vs 0.87、MMToM-QA 0.84 vs 0.98、MuMA-ToM 0.88 vs 0.96 仍有差距。(2) 稳定性:组内标准差均值 0.036,最大极差 0.201,集中在确定性求解策略。(3) 验证效率:中位 5 次评估,最优验证分与全集 $r=0.96$、乐观差距仅 0.021,迭代次数与结果无关($r=0.17$)。(4) 技术归因:格式强制 100%、路由 95% 普及;极性逻辑 +0.090、结构化抽取 +0.055 最强;McNemar $\chi^2=1424.4$,修正 1717 题仅破坏 105 题,顶脚手架修正并集覆盖 97% 错误。(5) target 依赖:弱 target +0.262、强 target +0.110,余量定律 $r=0.75$,强 target 上 9/20 例回退。(6) builder 努力:0.711→0.856 单调上升(Spearman $\rho=0.77$)。(7) 认知负荷:确定性比例与准确率 $r=0.72$,卸载度 BigToM 0.94、MuMA-ToM 仅 0.36。(8) 残差:Hi-ToM 四阶递归 0.700、MMToM 贝叶斯题型 0.680。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 四 ToM 基准宏平均(target:GPT-5.4-mini) | macro-average accuracy | 0.912(最佳运行:GPT-5.5 + GPT Codex) | 0.488(无脚手架直接调用);0.619(无脚手架 GPT-5.4) | +0.423(相对提升 86.7%),超过升级到更强的 GPT-5.4 |
| BigToM(观察/未观察社会推理,1200 题) | accuracy | 1.00(最佳脚手架,几乎全确定性求解) | 0.503(无脚手架);0.95(人工 UserHarness) | +0.497,并反超人工 harness 0.05 |
| Hi-ToM(0-4 阶嵌套信念,1200 题) | accuracy | 0.803 | 0.569(无脚手架);0.87(UserHarness) | +0.234,距人工 harness 尚差 0.07 |
| MMToM-QA(贝叶斯目标推断,600 题) | accuracy | 0.84 | 0.412(无脚手架);0.98(UserHarness) | +0.43,距人工 harness 差 0.14(差距最大) |
| MuMA-ToM(多智能体信念,900 题) | accuracy | 0.88 | 0.469(无脚手架);0.96(UserHarness) | +0.41,主要仍靠模型自身推理 |
| 强 target 对照(target:Gemini-3.5-flash) | macro-average accuracy | 0.939(最佳:Gemini-3.5-flash 自建于 Cursor) | 0.761(无脚手架) | +0.178;McNemar 修正 772 题破坏 63 题($\chi^2=600.3$) |
| 弱 vs 强 target 平均提升(5 个 builder 匹配对比) | macro uplift | GPT-5.4-mini +0.262(0.488→0.750) | Gemini-3.5-flash +0.110(0.761→0.871) | 弱 target 提升约为强 target 的 2.4 倍,余量定律 $r=0.75$ |
局限与改进
作者承认的局限:实验限于 ToM 域,尚未在更广基准族上验证普适性;BigToM 上最优脚手架本质是把基准「编译」成规则技能的捷径——作者辩护称在固定指令与验证集约束下发现可利用结构本身就是 builder 能力的一部分,但这确实使该基准上的 1.00 分无法解读为真实的心智推理能力;确定性求解策略方差大(最大重复极差 0.201),单条规则错误可使千题基准波动数十分;自动脚手架与人工精雕的 UserHarness 在 Hi-ToM、MMToM-QA、MuMA-ToM 上仍有 0.07-0.14 的差距。我自己的观察:四个基准全部是二元或三选一的封闭选项题,特别适合格式强制与确定性卸载,结论向开放生成、长文本任务外推需谨慎;技术归因基于共现关联而非受控干预(作者亦承认);builder 侧超高推理努力与上千行脚手架代码的 API 成本未报告,「用最强 builder + 超高努力」的经济性不明;隐藏测试集与验证集同分布,无法检验脚手架在分布漂移下的鲁棒性。
独立分析的弱点
第一,评估域窄:仅覆盖封闭选项的 ToM 任务,数学证明、代码生成、开放对话等难以编译成规则的场景完全未测,改进方向是构造「可编译性梯度」基准族,系统测绘确定性卸载的适用边界。第二,确定性求解器脆弱:一条基准规则写错即可造成数十分波动(最大极差 0.201),改进方向是让 builder 为同一子任务生成多个独立求解器实现并做差分测试,或对规则做形式化验证后再部署。第三,强 target 过度脚手架回退(9/20 例,Hi-ToM 平均 -0.04、MuMA-ToM -0.02):说明固定脚手架可能干扰本来正确的行为,改进方向是基于实测 headroom 的自动门控,仅在子任务级、有明确验证证据时注入结构。第四,归因非因果:「极性逻辑 +0.090」等数字来自共现对比,改进方向是固定其他组件、逐项移除技术的受控消融。第五,成本盲区:builder 超高推理努力与脚手架构建的 token 开销未报告,应补全端到端成本-收益曲线,与「直接调用更强模型」对比每题成本。第六,论文建议「建 2-3 个脚手架选验证最优」以稳住方差,但这直接翻倍构建成本,可探索更便宜的脚手架自动回归测试方案。
未来方向
作者提出的方向:把强到弱脚手架推广到符号结构、模糊性与开放式推理比例不同的更广基准族;将其发展为 builder 模型的标准 benchmark——提供工作区、弱 target、固定任务与验证集,以隐藏集得分为主指标,验证用量、推理成本、代码复杂度、跨重复鲁棒性与卸载比例为次要指标;研究 harness 自进化,让 agent 系统与其基础设施协同演化;探索训练与 harness 两条路线的互补——模型可训练得更善于使用特定 harness,harness 也可围绕特定模型强弱自动优化。基于本文成果可延伸的方向:多脚手架集成——顶脚手架修正集合的并集已覆盖 97% 基线错误且互补性强,路由或投票式集成可进一步逼近天花板;引入显式信念状态追踪模块,攻击高阶递归加欺骗(Hi-ToM 四阶仅 0.700)与贝叶斯目标推断(MMToM 题型 2.1 仅 0.680)的残余硬核;在测试流上在线更新脚手架的持续自适应机制;把 determinism fraction 沉淀为通用的「任务可编译性」度量,用于新基准发布前的自动结构分析。
复现评估
复现评估:这是 Salesforce 的预印本,论文未提及开源代码或公开脚手架库,目前需要完全重新实现。可用资源:四个 ToM 基准全部公开(BigToM、Hi-ToM、MMToM-QA、MuMA-ToM),按论文组装 3900 题测试集并用固定随机种子抽 5%(195 题)验证集即可。算力与成本:无训练开销,但需要 8 个商业模型的 API(Opus-4.7、Sonnet-4.6、GPT-5.5、GPT-5.4-mini、Codex-5.3、Gemini-3.1-Pro、Gemini-3.5-flash、Grok-0.1)与 3 个 agent 平台(Cursor、Claude Code、GPT Codex)的订阅;完整 72 次运行含 3900 题 × 16 并发的 target 调用,费用可观,但复现主结论可缩减到少数 builder-target 组合。主要风险是模型 API 与 agent 平台的持续版本漂移,会使精确数字难以对齐。难度评级:方法本身简单(算法 1 与附录指令完整给出),中等投入即可复现数量级结论;要精确复现全部 72 格则较难。
论文图表
(a) Hi-ToM 准确率随递归阶下降:0 阶 0.999 → 4 阶 0.700,欺骗场景进一步降低表现(0.829 vs 0.772),且脚手架优势在深递归处收窄;(b) 8 个最强脚手架的修正/破坏分解:平均修复 83% 基线错误、仅破坏 7% 正确题目。
标定自动脚手架的能力边界:能编译的结构几乎被吃净,剩余错误集中在嵌套信念递归与贝叶斯目标推断这些难以规则化的推理硬核——指出未来工作的主攻方向。