← 返回 2026-08-18

PACE-Bench:动态环境下基于代码演化的物理自适应能力基准 PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments

Yuhao Zhan, Bingxiang He, Zecong Tang, Chaojun Xiao 📅 2026-08-14 👍 28 2026-08-23 18:30
LLM智能体 代码生成 基准评测 物理仿真 环境适应 自进化智能体

用144对物理突变任务检验智能体改代码自救的能力,揭示机制重设计而非参数推断是真瓶颈

前置知识

自进化智能体

指智能体用自身交互轨迹持续改进未来行为:把反馈转化为参数更新、上下文修订、记忆或工具改造,减少人工重设计。四大范式:上下文反思(Reflexion 等)、记忆增强(ACE 等)、推理时搜索(ToT 等)、参数训练(SEAL 等)。

本文的评测对象正是这十种自进化方法,全文的方法对比、范式分析与核心结论都建立在对这四类范式的区分之上。

源→目标环境对

基准的基本评测单元:在源环境 $E_0$ 验证成功的代码设计,配一个经系统性物理突变得到的目标环境 $E_k$,目标与 API 接口相同、只差隐藏物理参数。要求目标可解且源解失效($x_0\in X_0\setminus X_k$),每对限 20 次尝试。

这一对结构同时排除了“直接复用旧方案”与“任务本身不可解”两种平凡情形,是理解全文评测协议、指标与所有结论的前提。

Box2D 沙盒与诊断反馈

Box2D 是 OpenAI Gym 等平台常用的 2D 刚体物理引擎,本文以 60 FPS、至多 10000 步运行智能体提交的 Python 设计,返回 $E_i(x)=(v(x), s(x), d(x))$:约束满足率、得分与诊断报告(峰值关节力、失效时间戳等),原则是“诊断而不开药方”。

智能体的全部适应只能依赖这些反馈信号,反馈的信息含量直接决定方法表现,也是参数披露(CH/CE)与视频反馈两个干预实验的基础。

Pass@2 与 Score@2

每对环境用两次独立运行评估:Pass@2 记录至少一次拿到满分 $s=100$ 的比例,Score@2 取两次各自最佳得分的均值(单次得分 $[-100,100]$)。因截断、解析失败、沙盒崩溃而无完整可执行解的运行被剔除。

这是全文所有主表的指标定义,理解其“两次机会”语义与分母剔除规则,才能正确解读 35.9%、66.7% 这些数字的含义与局限。

四类自进化范式与代表方法

上下文类:Reflexion 失败后生成反思注入提示,Self-Refine 做无验证自评。记忆类:ACE 维护策略手册,ExpeL 提炼规则,ReasoningBank 归纳记忆条目。搜索类:ToT 束搜索,CodeEvolve 种群进化。参数类:SEAL/RAGEN/TTT-Discover 做测试时参数更新。

论文按范式归纳成败规律(如“记忆锚定”“搜索不收敛”),不熟悉各方法的运行机制就无法读懂 RQ2 的失败归因分析。

测试时训练与 LoRA

不改动预训练权重、只在评测任务上做的小规模参数更新:SEAL 每轮在累积(提示,代码)正例上重训 LoRA;RAGEN 把代码修订当多轮 episode 做 RL;TTT-Discover 用组内候选相对优势做梯度步。LoRA 是低秩适配器,只训练少量附加参数(本文秩 32-64)。

参数类方法与另外三类的本质差异在于“改权重”,这是理解 RQ1 中参数法在 14B 上全面落后 Vanilla 这一反直觉结果的基础。

研究动机

自进化智能体 promised 用交互经验改进未来行为,但现有评测都在“固定执行条件”下优化:StreamBench、LifelongAgentBench、SEA-Eval 等检验反馈能否在任务流上持续提分并保持稳定,SE-Bench、SEAGym、AutoEnv 等检验 prompt、代码或框架更新能否泛化到 held-out 任务与环境——没有一个测“曾经成功的设计在执行环境改变后失效,智能体能否把它改回来”。另一侧,物理与工程类基准要么研究固定条件下的仿真设计(ENGDESIGN)、可执行反馈工程(Frontier-Eng),要么改变物理环境但不考察自进化重设计(CausalWorld 的因果迁移、NewtonBench 的物理定律发现)。而真实部署中环境漂移是常态:摩擦、材料强度、风力、重力的变化随时让原本可用的方案失效——作者用一辆在高摩擦地面能跑的车到了冰面抛锚作直观例子。这既不是知识迁移也不是泛化问题,而是“适应性改造”问题,此前没有任何基准系统性评测它。

本文的目标是本文要构建 PACE-Bench:一个模拟器接地、完全可复现的基准,包含 36 个基础任务、6 个物理域、共 144 对源-目标适应对(每任务 4 个突变阶段)。每对任务给定一个在源环境验证成功的代码驱动设计,随后系统性突变隐藏物理参数(摩擦、重力、风力、关节强度等)构造目标环境:源设计必然失效、参考解经验证可解。智能体在目标与接口不变、隐藏参数未知、仅有诊断性沙盒反馈的条件下,须在 20 次尝试内迭代修改代码使设计重新达标。在此协议上,作者横向对比 4 大范式 10 种自进化方法与多个模型规模(Qwen3-4B/8B/14B 全量扫描,Statics 子集加测 Qwen3-32B、DeepSeek-V4-Pro、GPT-5.5),并配套失败轨迹归因(九类错误分类 + 代码相似度分析)与两类干预实验(披露突变参数、VLM 视频反馈),回答三个递进问题:现状多好(RQ1)、为何失败(RQ2)、什么设计选择有效(RQ3)。

与已有工作不同的是,本文的独特切入是把“环境变化”做成受控变量而非背景噪声。与先前工作不同,PACE-Bench 固定任务目标与 API 接口,只突变隐藏物理参数,从而把失败精确归因于“物理假设过时”而非任务定义改变。三重保障使它区别于所有前作:其一,目标环境必须存在经验证的参考解(可解性 $X_k\neq\emptyset$);其二,源解必须在所有目标环境失效(非平凡性 $x_0\in X_0\setminus X_k$);其三,反馈是“诊断不处方”的结构化物理量——只报“关节在 42 步因力矩超限 35% 断裂”,不给修法,且重力、摩擦等数值型隐藏变量从提示中清洗,只留统一后缀 $U$ 的泛化提示,人为构造信息不对称。由此把“知其然”(推断什么参数变了)与“知其所以然”(重设计机制)解耦成可分别干预、分别检验的两个能力,这是首个把环境变化、代码驱动重设计与自进化评测合为一体的基准(Table 1 能力矩阵中唯一五列全勾)。

核心方法

直觉上,这像考核一名工程师:先让他的方案在高摩擦地面跑通,再悄悄把它扔到冰面上看它翻车,给他 20 次附带检测报告的修改机会,看能否改好。技术上,基础任务由上下文模板 $C$ 与五个环境 $\{E_0,\dots,E_4\}$ 定义,实例为 $\tau_i = C(E_i)$,每个环境 $E_i=(\theta_i,\phi_i)$ 由地形 $\theta$ 与物理参数 $\phi$ 参数化。解 $x$ 是一个 Python 程序,须定义 build_agent()(结构装配)与 agent_action()(控制逻辑)两个函数,在 Box2D 沙盒(60 FPS、单次最多 10000 仿真步)中执行,评测器返回 $E_i(x)=(v(x), s(x), d(x))$,其中 $v(x)=K/N$ 为 $N$ 条硬约束(质量预算、不许坍塌等)满足的比例。得分函数分段:$v(x)<1$ 时 $s(x)=(v(x)-1)\times 100$ 惩罚违约;$v(x)=1$ 时衡量任务进度;$s(x)=100$ 当且仅当 $x$ 达到参考解水平。适应对 $(E_0\to E_k)$、$k\in\{1,2,3,4\}$ 满足 $X_k\neq\emptyset$ 且 $x_0\in X_0\setminus X_k$。智能体(骨干 LLM 加自进化方法)在第 $t$ 步提交 $x_t=\mathcal{A}(C(E_k)\oplus U, H_{t-1})$,$H_{t-1}=\{(x_i,v_i,s_i,d_i)\}_{i=0}^{t-1}$ 为历史,$U$ 是只列“可能变化的变量类别”却不知具体何值何变的统一后缀;最终分 $s=\max_{0\le t<B} s_t$,预算 $B=20$。指标为两次独立运行的 Pass@2 与 Score@2。

核心创新是“源成功→突变→目标失效→带诊断修复”的评测协议本身,以及它对自进化方法成败机理的可解释性放大。与已有基准的本质区别有三。第一,突变是系统性且经难度标定的:每任务从 Stage 1 到 Stage 4 突变参数从平均 2 个升到 10 个,且循环调整突变强度(更宽的沟壑、更严的力限制)直到 Qwen3-4B 两次独立运行都失败、而参考解仍保持满分——既非平凡又保证可解。第二,反馈工程遵循“诊断而非处方”四原则:物理接地(报峰值力、碰撞冲量等实数)、动态阈值(限值从当前环境配置读取)、诊断不处方(只报“什么坏了、超限多少”,绝不建议修法)、分阶段报告;数字型隐藏变量被自动审计从 prompt 中删除,只保留统一后缀 $U$ 的泛化警告,从而构造可控的信息不对称。第三,协议明确把能力分解为物理推断(“know what”:从反馈诊断隐藏变化)与机制重设计(“know how”:改结构以适应新物理),使参数披露、视频反馈等干预可以分别检验哪个才是瓶颈。这一设定让“记忆锚定 vs 探索发散”“知道变了什么也无济于事”这类机理结论第一次被量化。

方法步骤详情

数据构造是三阶段流水线(Figure 2)。阶段一(任务与环境生成):初始化 6 个物理域——静力学与平衡、运动学与连杆、动力学与能量、颗粒与流体交互、控制论、奇异物理,每域 6 个基础任务共 36 个;对每个任务从源环境 $E_0$ 出发按 Stage 1-4 逐级突变地形与物理(均值 2→3→9→10 个参数),得 4 个目标环境,共 $36\times4=144$ 对。阶段二(模块化架构与参考解推导):每个任务拆成七个单一职责模块——environment.py(物理与地形)、evaluator.py(成功判据)、feedback.py(诊断指标)、prompt.py(任务上下文)、stages.py(突变规格)、renderer.py(渲染)、agent.py(五个环境的参考解)——参数改动可跨层传播;用 Claude Code 迭代精化为五个环境各推导参考解,验证源解在全部 4 个目标环境失效。阶段三(验证与标定):自动审计脚本检查跨模块一致性、变量暴露(隐藏变量数值必须从 prompt 删除)、API 排他性七条规则;难度标定循环调整突变参数直至 Qwen3-4B 两次独立运行均失败而参考解满分;再用法证式分析从 4B 失败日志找出缺失诊断量,补进 feedback.py(若补齐后 4B 能过则继续加难);最后由两位有物理/工程研究生训练的作者分三遍人工审计全部 36 个任务,中重度问题率从第一遍约 86% 降到第二遍 15-20%、第三遍为 0。评测时,历史管理用“最近一次 + 历史最佳”截断策略(保留超过 95% 的全历史通过率),每次尝试产出结构化 JSON 诊断。

技术新颖性

技术新颖性有四点。其一,评测对象新:首个测“设计在环境变化后失效再修复”的基准,填平自进化评测与物理设计评测之间的空档——Table 1 中八个自进化基准都不含物理仿真与可执行设计,四个物理基准都不含变化后自进化评测,PACE-Bench 是唯一五项能力(反馈驱动改进、物理仿真、可执行设计、自进化评测、环境变化后适应)全勾的。其二,构造方法新:三阶段流水线把 LLM 生成、Claude Code 求解、七规则自动审计、Qwen3-4B 双运行难度标定、两作者三轮人工审核串成可复现的质量链,并把非平凡性写成形式化条件 $X_k\neq\emptyset,\; x_0\in X_0\setminus X_k$;难度提升只动 stages.py 与 agent.py,不引入新物理。其三,反馈工程新:feedback.py 的“物理接地、动态阈值、诊断不处方、分阶段”四原则与两阶段自动优化(六维法证分析→实现→去冗压缩)为诊断式反馈设计提供了可迁移模板。其四,分析工具新:九类互斥错误分类器(硬故障优先、轨迹模式次之的优先级管道)与 Jaccard 代码相似度三指标(全局相似度、收敛趋势、激进度)组合,把“锚定”与“盲探”两种失败模式变成可测量、可跨方法比较的指标,可直接移植到其他代码自进化评测。

Overview of the three-phase dataset construction pipeline.
Figure 2: Overview of the three-phase dataset construction pipeline.
Overview of PACE-BENCH. Left: the 36 tasks organized across six physics categories. Right: rendered snapshots of reference solutions succeeding on the source environments.
Figure 3: Overview of PACE-BENCH. Left: the 36 tasks organized across six physics categories. Right: rendered snapshots of reference solutions succeeding on the source environments.

实验结果

基准远未饱和,且没有一个范式稳定占优。全基准 144 对上,最佳配置 Reflexion+Qwen3-14B 仅 35.9% Pass@2(Vanilla 32.0%,仅 +3.9),增益主要来自 8B→14B;Self-Refine 因无验证内循环全面劣化(从未超过 7.1%,14B 上 -24.9);记忆类在 8B 小赚但 14B 反输(ACE 25.0%、ReasoningBank 24.2%、ExpeL 15.6%,均低于 Vanilla 32.0%),说明检索经验会束缚更强的模型;搜索类中 ToT 在 4B 上翻倍(23.4%,+11.9)但优势随规模消失(14B -11.7),CodeEvolve 随规模负增长(10.7%→5.3%);参数类三种方法在 14B 全部低于 Vanilla,RAGEN 差距从 -3.8 扩大到 -17.5。Statics 子集 20 次预算下,Qwen3 家族出现同族平台(14B 与 32B 均 37.5%),DeepSeek-V4-Pro 45.8%,GPT-5.5 66.7% 但仍败三分之一对。成本归一(Kinematics 子集):ToT 最快最省(45.7-57.8 Score/Hr),CodeEvolve 仅 3.7-7.5,Self-Refine 2.0-3.6。RQ2 失败归因呈两极:保守法锁定早期设计——Vanilla 41.0% Design Fixation、全局相似度 0.777,ACE 把 Stagnation 压到 7.5% 却把 Fixation 抬到 47.1%(评分排序检索形成正反馈锚定),ReasoningBank 收敛趋势最陡(+0.233),CodeEvolve 66.3% Fixation、相似度 0.835;激进法则探索不收敛——ToT 近零 Fixation(0.3%)但有 50.2% Stagnation,RAGEN 零 Fixation 但 42.9% Exploration,TTT-Discover Stagnation 55.6%。按类别,控制类 Fixation 高达 58.2%,奇异物理最可解(4B→14B +16.3),动力学最难,运动学几乎不随规模涨(+1.9),说明扩参更多提升推理而非组合搜索。RQ3 两项干预最反直觉:其一,公开精确突变值(CE)不抬高天花板——最佳 CE 成绩 14.6%(Reflexion-14B)仍低于最佳 CH 的 17.9%(Reflexion-8B),Vanilla-14B 反而降 7.2;其二,VLM 视频反馈(Gemma4-26B-A4B 生成失败描述)按范式极化——记忆法受益(ExpeL-14B 13.6%→36.4%),上下文法受损(Vanilla-14B 40.9%→18.2%)。从零构造同样难(Pass@2 11.3-18.3%;源环境 32.3% vs 突变目标 6.4-13.4%),证明突变本身制造了实质难度。全量本地扫描约 9500 条轨迹、19 万次 LLM 调用、4200 A100 GPU 小时。

Comparison of representative benchmarks for self-evolution, engineering design, and physical environments.
Table 1: Comparison of representative benchmarks for self-evolution, engineering design, and physical environments.
Main Results: Pass@2 (%) and Score@2 by Method and Model. Values in parentheses show Δ vs. Vanilla.
Table 2: Main Results: Pass@2 (%) and Score@2 by Method and Model. Values in parentheses show Δ vs. Vanilla.
Vanilla performance on Statics subset under the full 20-attempt budget.
Table 3: Vanilla performance on Statics subset under the full 20-attempt budget.
Cost-normalized results on the Kinematics subset under 20-attempt budget.
Table 4: Cost-normalized results on the Kinematics subset under 20-attempt budget.
Code Similarity by Method and Model (iterations ≥10). Trend (L−E) = mean similarity difference between late and early attempts; positive = increasing self-similarity.
Table 5: Code Similarity by Method and Model (iterations ≥10). Trend (L−E) = mean similarity difference between late and early attempts; positive = increasing self-similarity.
Change-Hidden (CH) vs. Change-Exposed (CE) Pass@2 (%) pooled over Statics and Kinematics.
Table 6: Change-Hidden (CH) vs. Change-Exposed (CE) Pass@2 (%) pooled over Statics and Kinematics.
Dataset statistics by category (averaged over 6 tasks each). Stages 1–4 report average mutated physical parameters per stage.
Table 9: Dataset statistics by category (averaged over 6 tasks each). Stages 1–4 report average mutated physical parameters per stage.
VLM Video Feedback Impact on Statics and Kinematics.
Table 11: VLM Video Feedback Impact on Statics and Kinematics.
Vanilla from-scratch results by model.
Table 15: Vanilla from-scratch results by model.
Vanilla from-scratch results by target environment.
Table 16: Vanilla from-scratch results by target environment.
Error type distribution by category (left) and method (right).
Figure 4: Error type distribution by category (left) and method (right).
Pass@2 and Score@2 by model on Statics, Vanilla method, five-attempt budget.
Figure 5: Pass@2 and Score@2 by model on Statics, Vanilla method, five-attempt budget.
Pass@2@k and Score@2@k by model (all methods, all categories).
Figure 6: Pass@2@k and Score@2@k by model (all methods, all categories).
Model × category Pass@2 heatmap (all methods aggregated).
Figure 7: Model × category Pass@2 heatmap (all methods aggregated).
查看结构化数据
任务指标本文基线提升
全基准源→目标适应(144 对,20 次预算) Pass@2 (%) Reflexion + Qwen3-14B:35.9(Score@2 28.0) Vanilla + Qwen3-14B:32.0(Score@2 25.5) +3.9,为全表最佳;距饱和很远
Statics 子集(24 对,20 次预算,Vanilla) Pass@2 (%) GPT-5.5:66.7(Score@2 78.1) Qwen3-14B / Qwen3-32B:37.5;DeepSeek-V4-Pro:45.8 +29.2(对 Qwen3-32B);但仍有 1/3 对失败
小模型上的推理时搜索 Pass@2 (%) ToT + Qwen3-4B:23.4 Vanilla + Qwen3-4B:11.5 +11.9(约 2 倍),但 14B 上转为 -11.7
无外部验证的自我修订 Pass@2 (%) Self-Refine:≤7.1(三规模全降) 同规模 Vanilla:11.5 / 15.6 / 32.0 -5.3 / -12.5 / -24.9,全面劣化
成本归一效率(Kinematics 子集,20 次预算) Score/Hr(平均分/运行小时) ToT:45.7 / 46.4 / 57.8(4B/8B/14B) CodeEvolve:7.5 / 4.1 / 3.7;Self-Refine:2.0 / 2.9 / 3.6 效率高约一个数量级,且不随规模崩溃
从零构造(无初始设计,Vanilla,全五环境) Pass@2 (%) 11.3 / 12.8 / 18.3(Qwen3-4B/8B/14B) 源环境同协议 32.3 vs 突变目标 6.4-13.4 证明突变目标实质更难,任务非平凡
参数披露干预(CH→CE,Statics+Kinematics) Pass@2 (%) 最佳 CE:14.6(Reflexion-14B) 最佳 CH:17.9(Reflexion-8B) -3.3:公开“什么变了”不抬高性能上限
VLM 视频反馈干预(Statics+Kinematics) Pass@2 (%) ExpeL-14B:13.6→36.4(+22.8) Vanilla-14B:40.9→18.2(-22.7) 按范式极化:记忆法受益、上下文法受损

局限与改进

作者明确承认三点:PACE-Bench 只在受控 2D Box2D 仿真中评测,结论未必迁移到 3D 环境或带噪声感知与执行的真实机器人;固定 20 次尝试预算限制了交互时域,持续/长期适应未被测试;出于算力成本,前沿模型、参数披露与视频反馈实验只覆盖选定域与方法(如五次预算的前沿对比仅 Statics 24 对)。我补充六点观察:其一,运行方差在小模型上不小——全基准两次运行 Pass/Fail 一致率 86.6%,4B 的 Spearman ρ 只有 0.667(14B 才到 0.976),故 4B 上的方法排序结论应谨慎;其二,九类错误分类与 Jaccard 相似度阈值是启发式(如 Fixation=近 3 次相似度>0.85 且分数趋势<3 且最佳<50),文本相似度高不等于设计空间收敛,可能误判“伪锚定”;其三,难度以 Qwen3-4B 两次失败标定,对前沿模型偏易(GPT-5.5 Statics 66.7%),“远未饱和”部分依赖模型弱而非任务本身难,缺少面向前沿模型的自适应难度标定;其四,记忆只在单次运行内积累,跨任务、跨对的终身学习效应没有被测量,与 StreamBench 式任务流设定脱节;其五,Pass@2 分母因截断/解析失败被剔除(平均 139.2/144),虽记录在案但引入轻微选择偏差,且恰好随方法变化(Self-Refine 剔除更多);其六,得分函数分段设计($v<1$ 罚违约、$v=1$ 测进度)使不同任务、不同类别的分数不可直接横向比较,Score@2 的跨任务均值解释需小心。

独立分析的弱点

第一,方法覆盖偏“存量”而缺“增量”:十种方法几乎原样搬用其原始实现,没有针对物理诊断反馈设计的专用机制,而 Reflexion 靠“接地反思”取胜恰恰暗示诊断量的结构化利用是金矿——改进方向是把力矩余量、事件时序等反馈显式编码进反思与记忆的表示,甚至训练一个“读诊断表”的专用模块。第二,探索-收敛失衡没有任何被测方法解决:ToT 广度搜索 50.2% Stagnation、CodeEvolve 种群坍缩 66.3% Fixation,两者是同一枚硬币的两面——改进方向是自适应切换广度/深度的搜索控制器,或对相邻尝试相似度设置显式多样性预算与强制变异算子。第三,记忆锚定的正反馈回路:ACE 的评分排序检索反复把早期中等成功注入 prompt 又再入库(案例研究中相邻尝试相似度升到 0.92、出现完全相同的连续提交),需要遗忘/降权机制,以及对“源环境经验在目标环境是否仍适用”的元标注——ExpeL 冻结源域记忆反而有害即是证据。第四,CE 不涨分提示“给更多信息”不是解法:应把参数推断与结构重设计建成显式两阶段流水线(先假设检验后拓扑重构),而不是把原始参数塞进上下文。第五,难度标定单点锚定 Qwen3-4B,建议改用多模型分位数或自适应难度,让基准对 GPT-5.5 级别模型也保持区分度。第六,20 次预算内失败后无任何跨对知识沉淀,无法回答“适应能力能否随经验增长”这一终身学习核心问题。

未来方向

作者提出的方向:把基准扩展到更丰富的模拟器(3D)与真实硬件、更长的适应时域、更广的模型与方法覆盖。基于其成果可延伸的方向:(1) 把诊断反馈接入因果发现/系统辨识模块——先自动拟合隐藏物理参数,再做模型预测控制式的结构重构,直接检验“know how”瓶颈能否被工具增强突破,这也是对 CE 负结果的最直接回应;(2) 记忆与搜索的混合(如 ReasoningBank + ToT)以及跨环境对的终身记忆,研究“适应经验”的可迁移表示;(3) 用九类错误标签训练失败预测器,实现预算内早停与算力动态分配,回应运动学类 44.5% Budget Exhaustion;(4) 迁移到 MuJoCo/Drake 等接触丰富 3D 仿真并注入感知噪声,检验结论的 sim-to-real 稳健性;(5) 多智能体协作重设计(分析员-工程师-评审分工),针对控制类 58.2% 的 Design Fixation;(6) 从 Figure 6 的预算-规模交互(更大多获益于更多尝试)出发,刻画适应型任务上“测试时算力 scaling law”的形态。此外,把“诊断不处方”的反馈设计原则反哺为训练信号(诊断条件化的 RL),可能同时提升 know-what 与 know-how。

复现评估

可复现性总体良好。代码与数据开源于 github.com/thunlp/PACE-Bench,提供统一代码库与评测套件;36 个任务的完整规格(源任务描述与四个目标环境的逐参数突变,Tables 17-22)、审计/反馈优化/难度提升的全部关键 prompt(附录 F)均公开。评测确定性较强:分数全部由硬编码评测器加 Box2D 执行决定,不依赖 LLM 评判,避免“LLM 评 LLM”的循环性;两次独立运行协议附带可靠性统计(86.6% 通过判定一致、中位分差 0、14B Spearman ρ=0.976),并论证了加第三遍运行的边际收益有限。算力门槛是主要障碍:全量本地扫描(Qwen3 三尺寸 × 11 方法 × 144 对 × 2 次)约 9500 条轨迹、19 万次 LLM 调用、4200 A100-80GB GPU 小时(需 25 卡 vLLM 集群,加跑一遍约 2100 小时);API 侧,六模型 × Statics 子集 × 5 次预算约 1440 次调用、约 2000 美元,而把前沿模型铺满全基准估算约 26.4 万美元/次。因此个人或小团队难以复现完整主表,但复现 Qwen3-4B 单尺寸、Statics 子集或 Vanilla/Reflexion 少数方法完全可行;难度标定依赖 Claude Code 构建参考解这一环节的开源程度也值得注意。综合评级:中等工作量、代码与数据齐备、算力是唯一硬门槛。