← 返回 2026-08-18

R³-Bench:大语言模型在共享预算下难以实现资源理性推理 R^3-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets

Peisong Wang, Zhiwei Ma, Bowen Liu, Feixue Liu, Aochuan Chen, Chenyi Zi, Hongchuan Zeng, Yuhan Li, Jia Li 📅 2026-08-17 👍 12 2026-08-23 18:30
LLM智能体 基准评测 测试时计算分配 组合优化 资源理性推理

共享预算评测显示,LLM竞赛成绩在72格中71格低于其单题能力的离线最优分配

前置知识

资源理性(Resource Rationality)

源自认知科学的理论框架(Anderson 1991;Lieder & Griffiths 2020),把认知建模为在有限计算资源约束下最大化期望效用的优化问题:智能体不仅要决定"做什么",还要决定"花多少算力去做"。关键概念是机会成本——把算力花在任务 A 上,就减少了任务 B 可用的算力。对 LLM 而言,推理消耗 token、工具调用、验证交互等资源,当多个任务共享同一预算时,跨任务的算力分配本身就成为推理问题的一部分。

本文的全部设计都围绕这一概念展开:R³-Bench 用共享预算制造机会成本,用同一模型自身的单题能力作为标尺,度量模型在资源理性意义下"兑现能力"的程度。不理解资源理性,就无法理解为什么单题得分高不等于套件得分高。

多重选择背包问题(Multiple-Choice Knapsack)

经典组合优化问题的变体:给定一组"物品组",每组内可选且仅可选一个物品,每个物品有成本和价值,在总成本不超过背包容量的约束下最大化总价值。标准 0/1 背包是它的特例(每组只有"选/不选"两个选项)。本文中每组是一个问题,组内选项是不同预算档位(含零档=不资助),价值是该档位下观察到的经验成功率,目标是共享预算下最大化期望答对题数。

论文的 oracle(最优分配参照)就是把响应曲线代入多重选择背包精确求解:六个问题、每题六个选项,直接枚举 $6^6=46{,}656$ 种组合即得最优解。理解这个结构才能明白 oracle 为什么是"经验上界"以及它的成本和价值项如何定义。

响应曲线(Response Curve)

指单个问题在不同预算水平下的成功率和资源消耗关系:在一个预算网格(本文取 $\rho\in\{0.05,0.1,0.2,0.4,0.8\}$ 乘以模型无预算自然资源消耗)上,每个档位独立重复运行 $K=5$ 次,记录经验成功率 $q_p(\ell)$ 和实际消耗 $C_{p,\ell,k}$。它刻画"给这道题多少算力、它有多大把握做对",是连接单题能力与套件级分配决策的桥梁。

R³-Bench 的两个关键诊断量——等分重放(每题是否有观察成本 $\le B/6$ 的成功运行)和响应曲线 oracle(用 $q_p(\ell)$ 解背包)——都直接构建在响应曲线之上。没有它就无法把"同一模型"的单题成功映射到共享预算场景。

测试时计算扩展与预算感知评测

测试时计算扩展(test-time scaling)指通过更长的思维链、更多采样、工具调用等额外推理期算力换取更高准确率(Wei et al. 2022;Snell et al. 2024)。预算感知评测则研究算力受限时的行为:TALE、SelfBudgeter 等工作在单个题目内部自适应分配 token 预算,AgentBench 等 Agent 基准为每个任务单独计预算。它们共同的问题是没有让多个任务争抢同一个预算。

本文的定位需要放进这条工作线来理解:它是第一个同时覆盖无工具与 Agent 设置、三个领域、且让六个问题竞争同一共享预算的套件级基准(论文 Table 1 的系统对比)。理解先行工作的缺口,才能理解本文的贡献坐标。

Agent 式评测与动作预算(Terminus-2/Harbor)

Agent 式评测让模型在交互环境中通过执行命令、运行代码、观察反馈来迭代解题,而不是一次性生成答案。本文用开源 Harbor 框架的 Terminus-2 沙箱实现,预算单位是"计费动作":只有执行解题计算的工具调用消耗预算,日常文件操作免费;另有 focus problem / shelve problem 两个免费簿记命令用于把动作归因到具体题目。运行时通过预算提醒向模型暴露已用/剩余配额,耗尽后阻止计费动作但允许收尾。

Agentic 设置是论文两大评测设置之一,且只有在这里模型才能"边观察反馈边重新分配",因此在线策略更新率、失败原因归因等核心诊断都依赖这个 harness 的动作计数与簿记机制。

研究动机

现有评测协议几乎都采用"一题一预算"的独立预算制:MATH、GPQA、LiveCodeBench 等推理基准每次只评一道题,AgentBench、SWE-bench 等 Agent 基准虽然加了工具与长程交互,但同样为每个任务单独分配预算。在这两种设置下,模型永远可以把全部算力倾注在当前问题上,跨问题的算力分配问题根本不会出现。然而真实工作负载并非如此:据统计超过 10% 的 Codex 用户每周同时管理至少 3 个并发 Agent;对约 40 万条 Claude Code 会话的分析也表明,编码 Agent 的构建、调试、测试与运维经常同时进行。这些负载共享有限的 API 配额与推理容量,在一个任务上花费的算力会挤占其他任务的可用资源,产生实实在在的机会成本。更麻烦的是,即使个别研究触及预算(如 USACOArena 的信用制编码竞技场、CLEAR 的跨查询 token 分配),也没有把分配质量与同一模型的单题推理能力做校准对照,因此无法回答一个基本问题:当计算存在机会成本时,LLM 能否兑现它已经被证明拥有的单题解题能力?

本文的目标是本文的目标是构建一个套件级基准 R³-BENCH,把"解题能力"与"预算兑现能力"这两个被现有基准混在一起的变量干净地分离。具体做法是:在数学(Omni-MATH、MathNet)、竞赛编程(LiveCodeBench Pro)、抽象推理(Reasoning Gym)三个领域各冻结 300 题的题池,各构造 50 场六题"竞赛",六题共享同一个算力预算;同一套竞赛同时在无工具推理(输出 token 预算)与 Agent(计步动作预算)两种设置、强($\rho=0.2$)与中($\rho=0.8$)两档压力下评测。关键的度量设计是:用每个模型自己的单题匹配响应曲线,构造等分重放基线和一个离线经验 oracle,然后度量实际竞赛分数与 oracle 的差距 $\Delta_{RR}=\text{Oracle}-\text{Contest}$。由于 oracle 只取材于该模型自己已经观察到解题成功的运行,差距完全归因于分配失败而非能力不足。论文还要进一步回答三个衍生问题:差距是否随预算压力迁移形态、是否与通用能力(ECI 指数)解耦、以及轻量在线调度能挽回多少。

与已有工作不同的是,本文的独特切入角度有三层。第一,评测单元从单题改为"六题共抢一个预算"的竞赛套件,借鉴 ICPC/IOI 竞赛中固定时间如何在题目间分配的真实结构,把时间分配转译为计算分配,这在 LLM 评测中尚无先例(论文 Table 1 的系统对比显示,此前没有任何工作同时覆盖无工具+Agent、多领域和真正的共享预算)。第二,标尺内生化:不是用别的更强模型或理论模型当上界,而是用同一模型自身在预算网格上的响应曲线构造 oracle——一个只授予观察到的单题成功、受同一总预算约束的离线经验最优分配。这使 Gap Ratio 成为 within-model 量,天然排除了模型间能力差异的干扰,也让"差距与通用能力无关"的判别分析成为可能。第三,诊断的系统性:压力水平按模型自身无预算消耗校准,失败原因逐例归因(18,000 条轨迹穷尽式人工标注),并用 target-in-suite 对照实验专门排除"只是上下文变长导致的"这一替代解释。

核心方法

直觉上,R³-BENCH 把多题编程竞赛(ICPC/IOI)中"固定比赛时间如何在题目间分配"的结构移植到 LLM 的算力分配上:所有六个问题共用一份预算,花在一题上的算力直接减少其余题目的可用量,模型必须自己决定尝试哪些题、每题投入多少、何时继续、切换或放弃。技术路线分四步。第一步,构建与分层:每个领域冻结 300 题(数学来自 Omni-MATH 与 MathNet,编程来自 LiveCodeBench Pro,抽象推理来自 Reasoning Gym),用三个参考模型(DeepSeek-V4-Pro、GLM-5.2、GPT-5.5)无预算运行的平均输出长度做难度代理——自然输出越长的题越"难"(即资源需求越高),把最短 150 题标为 Easy、次 100 题 Medium、最长 50 题 Hard,难度标签只用于组卷与分析、对模型隐藏。第二步,组卷:每领域 50 场竞赛,每场固定 3 Easy + 2 Medium + 1 Hard,题目呈现顺序随机化。第三步,预算校准:先无预算运行测得模型自然资源消耗 $R^\infty_{m,d}$(只统计成功完成的竞赛),再设 $R^\rho=\rho R^\infty$,$\rho=0.2$ 为强压力、$\rho=0.8$ 为中压力;无工具设置以输出 token(max_tokens)计,Agent 设置在 Harbor 的 Terminus-2 沙箱以计费动作计。第四步,评测与诊断:每场竞赛独立重复 5 次,主指标为平均答对题数,辅以等分重放、响应曲线 oracle、轨迹级人工标注和在线调度干预实验。

核心创新是"同模型响应曲线 oracle"。先在预算网格 $\Lambda=\{0.05,0.1,0.2,0.4,0.8\}$ 上对每个问题独立运行 $K=5$ 次(每题 25 次单题运行),得到经验成功率曲线 $q_p(\ell)$ 与各档名义成本 $c_p(\ell)=b^\ell$;然后让 oracle 在六题共享总预算 $B$ 的约束下解多重选择背包:$\max_z \sum_p \sum_\ell q_p(\ell) z_{p,\ell}$,约束为 $\sum_p \sum_\ell b^\ell z_{p,\ell}\le B$ 且每题恰选一个档位(含零档=不资助),通过穷举 $6^6=46{,}656$ 种组合精确求解。由于 oracle 只复用该模型自己观察到的单题成功,它不是可执行策略、也不是理论上限,而是"同样的总预算、换一种分配能多对几题"的经验度量。这与已有工作的本质区别在于:TALE、SelfBudgeter、AdaCoT 等只在单题内部做预算感知,AgentBench、SWE-bench 等给每个任务独立预算,USACOArena 和 CLEAR 虽有跨任务分配但不以模型自身单题能力为标尺。R³-BENCH 是第一个让"多题争抢同一预算"与"以自身能力为镜"同时成立的评测框架,因此报告的差距可以干净地解读为已展示能力的兑现损失。

方法步骤详情

完整流程如下。(1) 校准:对所有竞赛做无预算基线运行,记模型 $m$ 在域 $d$ 的自然资源消耗为 $R^\infty_{m,d}$(被运行时安全上限截断的样本剔除),按 $R^\rho_{m,d}=\rho R^\infty_{m,d}$ 设定两档压力的预算,离散资源四舍五入取整。(2) 单题响应曲线:每个问题在 $\Lambda$ 的每个正档位独立跑 $K=5$ 次,记录判定结果 $v_{p,\ell,k}\in\{0,1\}$ 与实际消耗 $C_{p,\ell,k}$——编程以可执行判题器通过为准,数学与抽象推理由领域专属的解析与判题流程判定。(3) 等分重放:计算每题的最小观察成功成本 $C^\star_p=\min C_{p,\ell,k}$,若 $C^\star_p\le B/6$ 则该题计 1 分,作为固定均匀分配的事后基线(不重跑模型、不转移份额)。(4) oracle:如上解多重选择背包,平手时取总成本最小的分配。(5) 竞赛评测:共享预算下每场 5 次重复,报告 Contest 均分、$\Delta_{RR}$ 与 Gap Ratio $=\Delta_{RR}/\text{Oracle}$。(6) 失败归因:对 oracle 选中但竞赛中未解出的题,按轨迹证据归入唯一主因——从未尝试 / 尝试太晚 / 部分进展后停止 / 预算花在别处 / 误读工具反馈 / 格式或收尾错误 / 确实解不出,证据不足则剔除。(7) 在线适应标注:10 名标注者对 6 模型 × 2 压力 × 3 领域 × 2 设置 × 50 竞赛 × 5 重复共 18,000 条轨迹做穷尽式标注,记录观察证据→实质策略更新→更新是否资源理性→是否未能修复缺口,正面标签必须附精确引文。(8) 干预实验:在 3 个模型上对比两种只使用运行时可见信息的调度策略——策略 A 强制初始覆盖(对某题花第二个计费步前必须先探测所有可见问题),策略 B 在 A 之上加验证闸门(覆盖完成后限制对稳定候选的重复付费检查)。

技术新颖性

技术新颖性体现在四个层面。其一,问题形式化:首次把"资源理性推理"操作化为共享预算套件评测,让机会成本成为受控实验变量,而非笼统地测"预算内准确率"。其二,oracle 的构造哲学:它刻意做成离线经验诊断而非可执行策略,使用名义档位成本而非个别运行的实际消耗,使 oracle 选项的成本固定且与具体运行的运气无关;同时作者诚实界定了它不是理论上限(网格粒度有限、$K=5$ 有采样噪声),这种定位上的精确性本身就是方法学贡献。其三,混淆控制:预算按每个模型自身的无预算消耗校准,避免绝对预算对不同输出风格模型施加不同压力;target-in-suite 诊断(只要求解一题但六题全部可见)专门把"上下文变长"从"分配失败"中剥离,12 格中 9 格损失不超过 5 个百分点,均值仅 1.1pp。其四,证据体系:6 个模型 × 2 设置 × 2 压力 × 3 领域的完整主表(72 格)、18,000 条轨迹的穷尽式(非抽样)人工盲标(隐藏模型身份与难度标签)、以及与 ECI 能力指数的判别效度分析(全局平均 Spearman $=-0.29$,$p=0.37$;合并的组内 $R^2=0.01$)。这些设计合起来使"LLM 会解题但不会分配"这一结论第一次有了严格的量化支撑。

Overview of R3-BENCH.
Figure 2: Overview of R3-BENCH.

实验结果

核心发现可以逐条展开。(1) 差距普遍存在:72 个主表格子(6 旗舰模型 × 2 设置 × 2 压力 × 3 领域)中,oracle 全部不低于竞赛分,其中 71 格严格更高;唯一例外是 Claude-Opus-4.8 的 Agentic Math $\rho=0.2$(4.46 = 4.46,Gap 0.00%)。无工具设置下 oracle 平均每场多对 1.16 题(12 个模型-压力对的均值)。(2) 连朴素基线都能赢:$\rho=0.8$ 时固定等分重放胜过 6 个模型中的 4 个(DS-Pro、Qwen、GLM、Opus)的自身分配;而 $\rho=0.2$ 时等分份额过小(如 GPT-5.5 每题只有 38/47/6 个 token),等分分数近零,说明极端压力下需要非均匀分配。(3) 压力与工具的影响方向一致但不彻底:Agent 设置的 Gap Ratio 在 27/36 个匹配比较中低于无工具设置,$\rho=0.8$ 在 23/36 中低于 $\rho=0.2$;但差距依然巨大——Hy-3 Agentic AR $\rho=0.8$ Gap 81.48%,GPT-5.5 无工具 AR $\rho=0.2$ Gap 82.47%,Claude-Opus-4.8 无工具 Code $\rho=0.2$ Gap 68.09%。(4) 位置效应:全部 12 条模型-压力序列中第 6 位准确率低于第 1 位;强压力下第一题吸走 20.5–52.9% 的归因输出(中压力为 16.9–23.5%),六个模型中五个在强压力下更集中于早期位置(Qwen 例外)。(5) 在线适应稀缺:DS-Pro/Qwen/GLM/Opus 仅在 38.5–63.4% 的轨迹中做出实质策略更新,Hy-3 与 GPT-5.5 为零;六个模型中只有 DS-Pro 的资源理性更新率超过 50% 参考线。(6) 失败模式随压力迁移:强压力下主因是"预算花在别处"(GLM 42%、Hy 95%、GPT 66%、Opus 59%;Qwen 主因是尝试太晚 40%;DS-Pro 较分散,收尾错误 27%、误读反馈 24%);中压力下主因变为"部分进展后停止"(DS-Pro 67%、GLM 38%、Hy 38%、GPT 55%)。由于 oracle 只会选中单题已解出过的题,这些失败都指向投入不足而非能力上限。(7) 与通用能力解耦:ECI 差 2 分以内的模型 Gap Ratio 可差最多 60.6 个百分点;ECI 最高的模型在无工具 Math $\rho=0.2$ 上 Gap 反而最大(43.75%),而中游模型最小(4.32%);Table 12 中 12 个格子的 Spearman 相关多数接近零或为负(如 Agentic Code $\rho=0.8$ 为 $-0.90$),全局均值 $-0.29$($p=0.37$)。(8) 上下文长度不是解释:target-in-suite 诊断的 12 格中 9 格点估计损失 ≤5 个百分点,非加权均值仅 1.1pp。(9) 轻量调度有限且域敏感:策略 A/B 在 9 个模型-领域格中 6 格胜过竞赛基线,但三种策略各在 3 格拿到最佳;Code 对所有模型在两种干预下都改善,而策略 B 在所有 AR 行领先、在所有 Code 行落后于 A;Hy-3 即使有外部调度仍远低于 oracle(AR 上 A 0.48 / B 0.70 vs Oracle 3.14),说明静态指令无法替代模型自身的进展解读能力。

Comparison with budget-aware and resource-allocation-oriented LLM evaluations.
Table 1: Comparison with budget-aware and resource-allocation-oriented LLM evaluations.
Main results on R3-BENCH with domains as columns.
Table 2: Main results on R3-BENCH with domains as columns.
Online scheduler results for DeepSeek-V4-Pro, GLM-5.2, and Hy-3 in the Agentic setting at ρ = 0.2.
Table 3: Online scheduler results for DeepSeek-V4-Pro, GLM-5.2, and Hy-3 in the Agentic setting at ρ = 0.2.
Discriminant validity: Spearman correlation between model ECI and R3-BENCH Gap Ratio in each evaluation cell, with exact permutation p-values (n=5 models, 120 permutations).
Table 12: Discriminant validity: Spearman correlation between model ECI and R3-BENCH Gap Ratio in each evaluation cell, with exact permutation p-values (n=5 models, 120 permutations).
Problem-level allocation in the overcommitment case.
Table 15: Problem-level allocation in the overcommitment case.
Tool-free contest performance, equal-allocation replay, and response-curve oracle under strong (ρ = 0.2) and moderate (ρ = 0.8) budget pressure.
Figure 3: Tool-free contest performance, equal-allocation replay, and response-curve oracle under strong (ρ = 0.2) and moderate (ρ = 0.8) budget pressure.
Tool-free accuracy by presented position, averaged over strong and moderate budget pressure.
Figure 4: Tool-free accuracy by presented position, averaged over strong and moderate budget pressure.
Online adaptation in the agentic setting.
Figure 5: Online adaptation in the agentic setting.
Primary causes of positive oracle gaps across models and budget pressures.
Figure 6: Primary causes of positive oracle gaps across models and budget pressures.
Cumulative attributed-output share by presented position for all six models at both budget pressures.
Figure 9: Cumulative attributed-output share by presented position for all six models at both budget pressures.
Pure-NL answered/not-missing and budget-truncation rates by presented position.
Figure 12: Pure-NL answered/not-missing and budget-truncation rates by presented position.
查看结构化数据
任务指标本文基线提升
共享预算六题竞赛(主表全部 72 格汇总:6 模型 × 2 设置 × 2 压力 × 3 领域) oracle ≥ 竞赛分的格子数 / 平均每场多答对题数 oracle 在 72/72 格不低于竞赛分,71 格严格更高 各模型自身的共享预算竞赛分配策略 无工具设置平均差距 1.16 题/六题;Gap Ratio 最高 82.47%
抽象推理 · 无工具 · ρ=0.2(GPT-5.5) 每场平均答对题数(Gap Ratio) Oracle 1.94 Contest 0.34 Gap Ratio 82.47%(主表最大差距之一)
竞赛编程 · Agentic · ρ=0.2(Hy-3) 每场平均答对题数(Gap Ratio) Oracle 3.00 Contest 1.00 Gap Ratio 66.67%
数学 · Agentic · ρ=0.2(Claude-Opus-4.8) 每场平均答对题数(Gap Ratio) Oracle 4.46 Contest 4.46 0.00%(全部 72 格中唯一的零差距)
在线调度干预 · 编程 · Agentic · ρ=0.2(DeepSeek-V4-Pro) 每场平均答对题数 策略 A 4.10(策略 B 3.86) 竞赛基线 2.60(Oracle 4.90) +1.50 题(仍留 0.80 题未挽回)
判别效度:ECI 能力指数 vs Gap Ratio(12 个评测格) Spearman 相关(n=5 模型,120 次置换检验) 全局平均 −0.29(p=0.37),组内合并 R²=0.01(p=0.70) 若通用能力可预测分配质量则应显著为正 证明通用能力排名无法预测共享预算兑现能力

局限与改进

作者明确承认的局限:oracle 只是离线经验诊断而非可执行策略,更不是理论上限——预算只有 5 个正档位加零档,可能错过更细粒度下更优的分配;每档 $K=5$ 次重复带来采样噪声;等分重放衡量的是"收集到的运行中是否存在低成本成功",并非真的在 $B/6$ 硬顶下重跑,属于宽容的下界式基线;oracle 平手时的最小成本打破规则会影响选中哪些档位。我自己的观察:(1) 全对或全错的二元计分忽略部分分数与风险偏好,真实竞赛中"押注高分值难题"可能是理性策略,二元指标会把这类行为一律记为损失,Case A 的死磕案例在部分计分制下未必是非理性的;(2) 套件形式单一——固定六题、固定 3E+2M+1H 配比,未覆盖并发多 Agent、异构模型间分配、动态到达任务等更贴近真实调度(如 HiveMind 类工作负载)的场景;(3) 调度干预只在 3 个模型、两种手工策略、$\rho=0.2$ 的 Agentic 设置下测试,外推性有限;(4) 18,000 条轨迹的穷尽式人工标注成本高昂,且 10 人分工标注、无交叉一致性指标报告,"实质策略更新"与"资源理性"判据仍有主观空间;(5) 题目全部来自公开数据源,虽有降低污染的设计(如 Reasoning Gym 的可控生成、排除近期赛事题),记忆污染风险无法完全排除;(6) 位置效应与"越靠后的题在提示中离得越远"天然相关,target-in-suite 对照缓解但未完全消除顺序混淆;(7) 结论基于 2026 年前后的 8 个前沿模型,模型迭代很快,绝对数值的时效性有限。

独立分析的弱点

独立分析出的弱点及改进方向:(1) oracle 成本计价用名义档位上限而非实际消耗,同一档位内实际消耗方差很大,可能系统性高估某些"低名义项"的价值;改进方向是自适应细化网格(在成功边界附近加密)或以成功运行的成本分位数计价。(2) 缺少一个真正可执行的强分配基线:等分重放太弱、手工策略 A/B 太简陋,"外部调度只能部分挽回"的结论强度因此受限;改进方向是训练一个学习型调度器(如用模仿学习拟合 oracle 的分配决策)作为第三条对照线。(3) 二元满分判定会激励死磕:竞赛编程必须通过全部测试,部分通过零分,模型理性上可能倾向死磕一道已接近突破的题,二元指标无法区分"非理性固执"与"高风险押注";改进方向是引入部分分数或期望效用型指标并重新解释 Gap Ratio。(4) 顺序与位置的混淆未彻底排除:后面的题既被分配得更少,也在上下文中更远,两个因素纠缠;改进方向是做位置去相关的设计(如题目顺序与预算分配交叉平衡)或直接比较不同呈现顺序下的分配模式。(5) 行为标注的可靠性证据不足:虽然要求精确引文且隐藏模型身份,但论文未报告标注者间一致性(如 Cohen's kappa);改进方向是双标抽样并报告一致性。(6) 每题 25 次单题运行 + 每竞赛 5 次重复的设计意味着单格结论的置信区间不窄,但主表未报告误差棒或显著性检验;改进方向是补 bootstrap 置信区间,尤其对 0.6 个百分点级别的差距(如 Opus Agentic Math 的 0.00% vs 3.39%)应谨慎解读。

未来方向

作者明确提出的方向:把调度从外部指令内化为训练目标——训练一个能根据任务领域、当前进展质量与剩余预算决定覆盖/继续/切换/验证/停止的内部策略,使其保留领域特定行为、不干扰本来正确的模型决策,训练与评估留作未来工作;这与可验证奖励的 RL 天然契合,Reasoning Gym 等环境可直接复用。基于本文成果可以延伸的方向:(1) 把共享预算评测扩展到并发多 Agent、多模型编排与动态到达任务,对接 Codex 式真实工作负载(超过 10% 用户每周管理 3 个以上并发 Agent);(2) 用自适应响应曲线与效用型计分改进 oracle,使"离线上界"更紧、更接近真实最优策略;(3) 利用失败模式随压力迁移的发现(强压力=花在别处、中压力=部分进展后放弃)设计压力感知的解码干预,如预算比例触发的强制切换或收尾机制;(4) 把 R³-BENCH 作为 RL 训练环境直接优化 Gap Ratio,并检验策略跨域迁移;(5) 将 Gap Ratio 纳入模型评估体系,作为 ECI 等通用能力指数之外的正交维度,用于模型选型与路由(给"分配差但能力足"的模型配外部调度器);(6) 探索分配策略与测试时扩展(self-consistency、验证器调用)的联合优化,因为"何时停止"与"何时切换"在更复杂推理管线中会耦合。

复现评估

复现评估:中高难度但工程路径清晰。有利因素:论文带 Code 与 Dataset 链接;题目池全部来自公开来源(Omni-MATH 4,428 题、MathNet 30,676 题、LiveCodeBench Pro 持续更新、Reasoning Gym 程序化生成);Agent 沙箱用开源 Harbor 框架的 Terminus-2 harness;oracle 只是 $6^6=46{,}656$ 次枚举,任何笔记本可算;采样参数、思考模式配置(附录 Table 13)、沙箱与日志配置(Table 14)、动作计数规则(附录 F)、预算提醒模板(附录 D)都有完整披露;判题用领域标准判题器并有明确的成绩契约(Table 5)。主要门槛:(1) API 成本可观——每题 25 次单题响应曲线运行 × 900 题 × 8 个模型,加上 2 设置 × 2 压力 × 5 重复 × 150 场竞赛的运行和无预算校准运行,全部用前沿模型调用,粗估数十万次请求,论文未公布具体费用;(2) 18,000 条轨迹的穷尽式人工标注需要 10 名标注者各处理 1,800 条,人力是最大成本,复现者可以抽样标注替代;(3) thinking 模型的两阶段协议(Stage 1 计预算、Stage 2 只做答案抽取不计费)与按段落归因 token 的细节实现有一定工程复杂度。总体而言,这是评测类论文中可复现性较高的工作:方法、提示、配置齐全,瓶颈只在算力预算与标注人力,而非信息缺失。