先评估后改进:面向自动科研智能体的自动评分量表归纳 Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents
AutoSciRub 在执行前自动归纳可执行评分量表,引导科研智能体执行、验证与迭代修正
前置知识
科研智能体与智能体骨架(Agent Harness)
科研智能体是能自主完成文献调研、实验设计、代码执行与报告撰写的 LLM 系统;骨架指承载模型的工程外壳(如 Codex、Claude Code、OpenClaw、OpenScience),提供文件读写、代码执行、联网搜索等工具与循环控制。同一个骨干模型搭配不同骨架,会产生不同的行为和成绩。
本文所有实验都是骨干模型与骨架的配对比较(固定 Codex 换模型、固定 DeepSeek-V4-Flash 换骨架),AutoSciRub 以插件层方式叠加在骨架之上,不理解这层抽象就看不懂实验设计。
评分量表(Rubric)
把复杂产出拆解成一组显式、可独立判定的评分准则,例如报告必须包含基线对比表、图轴须标注单位等。专家量表可解释性强但撰写成本高、难以扩展到新任务;自动量表生成则从指令与上下文中派生任务专属准则。本文进一步区分只做事后打分的清单与规定怎么做、证据长什么样的可执行量表。
论文的核心主张就是量表应从评估工具升级为执行规范,全文的方法设计、消融实验与量表质量评估都围绕这一对象展开。
LLM-as-a-Judge(大模型评审)
用另一个强 LLM 按给定标准对产出打分或判定的评估范式。本文中 ResearchClawBench 用 GPT-5.1 对报告及其产物按隐藏量表评分(0-100 分,约 50 分代表达到目标论文复现水平),AstaBench 用 MiniMax-M3 对每条准则独立检查报告、代码、支撑产物三个方面后合成二值判定。
所有主结果都由 LLM 评委产生,理解其评分协议(每次提交独立评三次取均值、准则级二值判定取平均乘 100)才能正确解读实验数字及其噪声。
迭代自修正(Self-Refine)
让模型对自身输出执行评审-反馈-修改循环以提升质量的通用技术,典型做法是同一模型整体审视草稿后重写。其已知问题是反馈笼统、改进不稳定,甚至可能出现性能回退,因为模型不知道具体缺什么。
本文的量表引导修正正是针对整体式自修正的对照设计:表 3 显示无量表自精炼三轮仅累计 +0.77 且第二轮回退,而量表引导累计 +2.05,这一对比是论文因果论证的核心。
欠规约研究指令(Underspecified Instruction)
只陈述高层目标、不列明所需分析、方法、证据形式与成功条件的任务指令,例如综合多种观测度量全球冰川物质损失。隐含要求一旦被智能体遗漏,就会出现漏掉关键分析、使用错误流程、结论缺乏证据支撑等失败模式。
欠规约是全文问题陈述的起点:作者认为失败根源不是执行能力不足而是需求未显式化,自动量表归纳的目标正是把隐含需求变成可验证的显式规范。
研究动机
开放式端到端科研任务通常只给出高层次目标,例如综合多种观测来度量全球冰川物质损失,而把中间目标、方法要求、证据形式和成功条件全部隐含在任务里。作者在 ResearchClawBench(40 个任务、十个学科)上的实测显示,现有科研智能体在这种欠规约指令下表现很差:六个骨干模型与智能体骨架配置的 vanilla 平均分只有 14.49 到 20.86(满分 100,约 50 分代表达到目标论文水平),AstaBench 三个配置的 vanilla 平均分也只有 67.96 到 71.74。典型失败包括遗漏关键分析(缺少消融或基线对比)、使用错误流程(对不支持因果推断的数据下因果结论)、以及结论缺乏本任务实验证据的支撑。与此同时,现有基准中的专家评分量表只能对已完成产出做事后打分,既无法在执行中告诉智能体应该产出什么证据、还缺什么,又因需要大量领域专家手工投入而难以扩展到新任务。
本文的目标是本文的目标是让科研智能体先学会评估,再进行改进:在正式执行研究之前,自动从欠规约指令中归纳出任务特定的可执行评分量表,把隐含的实验要求、证据形式和成功条件显式化;然后将该量表同时用于三处——执行时作为任务规范指导实验与分析的规划,执行后逐条准则验证找出未满足的科学要求,再基于验证诊断做定向迭代修正而非整体重写。作者希望在不依赖领域专家手工撰写量表的前提下,跨骨干模型、跨智能体骨架、跨科学领域地提升科研产出质量,并验证这种评估先行机制能否成为可泛化、可插拔的通用控制层。
与已有工作不同的是,已有的自动量表生成工作大多把量表当作对已完成产出的事后评判工具,或从固定准则库中挑选条目;本文的独特切入点是把量表当作中间科学规范。具体差异有三:其一,量表在推理时按任务归纳而非检索,直接从指令分解出原子科学目标;其二,归纳过程有证据接地——每个目标都要经过科学文献接地(通过 arXiv、OpenAlex、Semantic Scholar、Tavily 检索并保留 5-7 篇核心文献)和任务数据探查(文件格式、字段、单位、标签、约束),保证准则既符合领域惯例又能被现有数据支撑;其三,量表进入执行回路,驱动准则级验证与定向修正,而不是只输出一个总分。作者还把验证与修正拆成两次独立调用,配合自适应早停,与 Self-Refine 式的整体自评形成方法论分野。
核心方法
直觉上,好的科研助理接到模糊任务会先想清楚要做哪些分析、需要什么证据、怎样算做完,再动手。AutoSciRub 将其形式化为两阶段。第一阶段自动量表归纳:给定任务 $\tau_i=(x_i,E_i)$,先由 $\hat{G}_i=\phi_{inst}(x_i)=\{g_{i,k}\}_{k=1}^{K_i}$ 生成量表格子,再经文献接地得知识 $K_{i,k}=\phi_{lit}(g_{i,k};e_i^L)$,经数据探查得档案 $P_i=\phi_{data}(E_i)$,最后合成可执行量表 $\hat{R}_i=\phi_{syn}(\hat{G}_i,\{K_{i,k}\},P_i)=\{\rho_{i,j}\}_{j=1}^{M_i}$。第二阶段量表引导迭代修正:智能体在 $\hat{R}_i$ 约束下产出初始成果 $A_i^{(0)}=(r_i^{(0)},S_i^{(0)})$,验证器逐条检查 $z_{i,j}^{(t)},d_{i,j}^{(t)}=Verify(\rho_{i,j},A_i^{(t)})$,失败条目汇成反馈 $\Delta_i^{(t)}$ 做定向修正 $A_i^{(t+1)}=\pi_{rev}(A_i^{(t)},\Delta_i^{(t)},E_i\mid\hat{R}_i)$,至多三轮并自适应早停。
核心创新是重新定义量表的角色:从事后评分工具变为执行时科学规范,把任务解读、研究执行、输出验证和迭代修正四个环节用一个显式规范串联起来。与已有方法的本质区别有三点。第一,归纳而非检索:不是从固定准则库挑选,而是在推理时根据指令、文献和数据动态合成任务专属准则,例如把确认单层石墨烯中的 Floquet-Bloch 态具体化为用 tr-ARPES 在 $\Gamma$ 点与避免交叉动量处提取 EDC、做多峰 Voigt 拟合、给出峰间距 $\hbar\omega\approx 248$ meV、标注坐标轴单位这样的可执行要求。第二,证据接地:每条准则都注明数据源、所需实验、指标、基线、期望产物(must_show)与满足条件,并明确区分本任务产出的证据与先前文献中的结论,防止拿文献陈述冒充实测证据。第三,准则级验证器输出结构化 JSON 诊断(goal_checks、rubric_item_checks、feedback_items),使修正如靶施治,而不是整体重写一遍。
方法步骤详情
流水线分七步。(1) 量表格子归纳:仅观察指令 $x_i$,产出 $K_i$ 个原子目标 $g_{i,k}=(n_{i,k},s_{i,k})$,不预设方法、指标或预期结果。(2) 文献接地:对每个目标构造覆盖概念、方法、指标、协议的宽泛查询,先读任务自带文献,再用 arXiv、OpenAlex、Semantic Scholar、Tavily 补充,按标题过滤隐藏目标论文黑名单,保留 5-7 篇核心文献,总结为方法、协议、典型分析、指标、基线、对照与证据形式。(3) 数据探查:轻量检查任务可见数据的格式、字段、单位、标签、实验条件与约束,仅用于规划。(4) 准则合成:三者合并成可执行量表,每条准则 $\rho_{i,j}$ 链接目标并指定实验、指标、基线、期望产物、数据源与满足条件。(5) 初始执行:依量表完成实验、分析并产出报告与支撑产物。(6) 准则级验证:检查各目标所需实验、结果、图表、结论与机制解释,输出结构化 JSON 诊断与修改建议。(7) 定向修正:依反馈补实验、改图、修正无据结论,序列 $V^{(0)}\to R^{(1)}\to V^{(1)}\to R^{(2)}\to V^{(2)}\to R^{(3)}\to V^{(3)}$,通过即停,至多三轮。
技术新颖性
技术新颖性体现在四个层面。首先,评估先行的框架设计把评估从执行链末端挪到前端,量表成为可执行的中间规范,这是对科研智能体评估范式的重新定位。其次,三源接地机制(指令加文献加数据)保证了准则的科学可行性与数据可行性:文献接地提供领域惯例(用什么指标、做什么对照),数据探查防止提出无法实现的分析(如假设存在标签或参考值),这一组合在此前的自动量表生成工作中没有同时出现。第三,验证与修正解耦:验证调用只诊断不修改、修正调用被禁止调用验证器;验证器的 overall_pass 是对目标和条目的综合 LLM 判断而非确定性合取,低优先级条目可由科学论证豁免,避免了过度阻断。第四,自适应早停让算力集中在未通过的任务上:40 个任务共产生 103 个真实报告检查点(40 加 40 加 17 加 6),任务通过后不再生成人工报告,而是沿用最近一次真实报告与已有分数计算后续轮次的均值。
实验结果
主结果分三组。(1) ResearchClawBench 跨模型(固定 Codex 骨架,GPT-5.1 评分):GPT-5.4 18.66→21.04(+2.38),GLM-5.2 20.86→22.73(+1.87),MiniMax-M3 19.05→21.04(+1.99),平均 +2.08。(2) 跨骨架(固定 DeepSeek-V4-Flash):Claude Code 16.60→18.74(+2.14),OpenClaw 17.25→20.36(+3.11),OpenScience 14.49→18.09(+3.60),平均 +2.95;60 组领域配对 49 组提升。(3) AstaBench 20 任务子集(MiniMax-M3 评分):Claude Code 71.26→90.62(+19.36)、Codex 71.74→84.35(+12.61)、OpenClaw 67.96→86.34(+18.38),平均 +16.78,前两者成功任务 18/20→20/20。消融单调增益:Base 17.25→格子 17.61→接地 18.31→修正 20.36。量表质量四维均分 2.20→3.84(具体性 1.65→4.40、可验证性 1.78→4.08、可执行性 2.00→3.83),科学内核覆盖度 3.35→3.07 略降。量表引导修正累计 +2.05,无量表自精炼仅 +0.77(约 2.7 倍)且第二轮回退;修正首轮 +1.16 后 23/40 任务通过,数学/地球/信息增益最大(+4.12/+3.73/+3.32),36/40 任务改善。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| ResearchClawBench 跨模型泛化(固定 Codex 骨架) | 总量表评分(0-100,GPT-5.1 评分,三次均值) | GPT-5.4:21.04(+2.38);GLM-5.2:22.73(+1.87);MiniMax-M3:21.04(+1.99);平均 +2.08 | 对应 vanilla 配置:18.66 / 20.86 / 19.05 | 六个配置全部提升,平均 +2.08 分,提升跨模型家族与基线强度一致 |
| ResearchClawBench 跨骨架泛化(固定 DeepSeek-V4-Flash) | 总量表评分(0-100,GPT-5.1 评分) | Claude Code:18.74(+2.14);OpenClaw:20.36(+3.11);OpenScience:18.09(+3.60);平均 +2.95 | 对应 vanilla 配置:16.60 / 17.25 / 14.49 | 平均 +2.95 分,领域层面 60 组配对中 49 组提升 |
| AstaBench End-to-End Discovery(20 任务子集) | 均值分(0-100,MiniMax-M3 评委)与成功任务数 | Claude Code:90.62(+19.36);Codex:84.35(+12.61);OpenClaw:86.34(+18.38);平均 +16.78 | 对应 vanilla 配置:71.26 / 71.74 / 67.96 | 平均 +16.78 分;Claude Code 与 Codex 成功任务 18/20 升至 20/20,OpenClaw 保持 19/20 |
| 阶段累积消融(40 任务,OpenClaw + DeepSeek-V4-Flash) | ResearchClawBench 总分 | 全流程 20.36(较 Base +3.11) | Base 17.25;+量表格子 17.61;+接地量表 18.31 | 三阶段单调增益,修正环节贡献最大(+2.05) |
| 量表引导修正 vs 无量表自精炼(同一 18.31 基线) | 三轮后累计分数增益 | 19.47 / 20.08 / 20.36,累计 +2.05 | 无量表自精炼 18.80 / 18.52 / 19.08,累计 +0.77(第二轮回退) | 约 2.7 倍,证明增益来自准则级反馈而非单纯多轮重写 |
局限与改进
作者承认并经分析揭示的局限包括:第一,量表归纳善于操作化但不善于定向——四维质量中科学内核覆盖度反而从 3.35 降到 3.07,如果初始格子漏掉了核心科学方向,接地与合成只会在次要或偏离的分析上展开而无法纠偏,高层科学判断仍依赖骨干模型。第二,算力不对等:加 AutoSciRub 引入额外的归纳、验证与修正调用,作者明确说明配对比较非算力匹配,也没有跨骨架的统一 token、时间或费用上限,因此部分提升可能来自更多计算预算。第三,验证器可靠性:overall_pass 是 LLM 判断而非确定性合取,低优先级条目可被科学论证豁免,存在误判风险;验证器输出缺失或不可解析时直接视为不通过。第四,评估依赖 GPT-5.1 与 MiniMax-M3 等 LLM 评委,每次提交独立评三次取均值仍有噪声,且量表式产出可能获得评委的系统性偏好。第五,AstaBench 只测 Easy 分层随机抽取的 20 个任务,而 ResearchClawBench 上绝对分普遍在 14 到 23 之间,距 50 分的目标论文水平仍很远,说明方法远未解决端到端科研问题。
独立分析的弱点
独立分析可见以下弱点。其一,量表格子一旦遗漏核心科学目标就系统性失效(覆盖度下降即证据),改进方向是归纳后引入反事实自检,或检索同领域已完成研究的目标集合做差异比对,并允许执行期发现方向偏离时回炉重写格子而非硬着头皮展开。其二,验证器与执行体同源(同一智能体或同族 LLM),自我验证的偏差未被量化,可引入独立小模型或规则化检查(文件存在性、图表 must_show 的自动视觉核验、数值一致性断言)构成混合验证。其三,收益集中在低分任务与 Easy 子集,对接近 50 分的高水平任务是否仍有效未知,应在 Hard 分层和更强基线上验证。其四,修正收益递减(+1.16、+0.61、+0.28)而每轮都要跑完整实验,需要预算感知的调度:按验证器给出的缺口严重度与风险优先级选择性修正。其五,外部检索依赖 Tavily 等服务,黑名单只按标题匹配隐藏论文,存在间接泄题或检索失败情形的鲁棒性风险。其六,量表四维质量仅用 MiniMax-M3 单一评委打分且缺少人工校验,质量结论可能存在同族模型循环依赖。
未来方向
作者在结论与引用中提示的方向包括:把自动归纳的量表用作强化学习奖励信号训练智能体内化评估能力(如引用的 DEEPRUBRIC、RubricRefine、Think-with-Rubrics 一类工作),以及与结构化长期记忆系统结合让跨任务积累的准则知识可复用。基于本文成果还可延伸:其一,跨任务量表迁移与准则库蒸馏,把高频准则模式沉淀为可检索先验,降低每次归纳的调用成本;其二,预算自适应修正,用缺口严重度决定是否继续迭代与何时早停;其三,把准则级验证扩展到多模态证据,例如对 must_show 图表做自动视觉核验;其四,人机协同接口,让领域专家只审阅修订量表格子这一小而关键的部分,以极小人力获得专家级规范;其五,在 Hard 分层、更长周期任务与真实实验室约束(湿实验、仪器可用性)中检验外推性;其六,系统研究量表诱导的失败模式与任务类型的关联,建立何时可以信任自动量表的判据。
复现评估
复现条件较好。代码已开源(github.com/zjunlp/AutoSciRub),两个基准均公开,作者完全沿用官方评测协议:ResearchClawBench 用 GPT-5.1 评分,AstaBench 用官方量表与 MiniMax-M3 评委;附录给出固定 20 任务子集(种子 20260707)、九种模型骨架评委配置表、量表 JSON 格式、验证器 schema 与四条质量评分 prompt 全文,透明度很高。所需资源:多款前沿模型 API(GPT-5.4/GPT-5.1/GLM-5.2/MiniMax-M3/DeepSeek-V4-Flash)、四套智能体骨架(Codex、Claude Code、OpenClaw、OpenScience)与 arXiv、OpenAlex、Semantic Scholar、Tavily 检索服务;每个提交评三次,主实验加消融对照共 103 个报告检查点逐个三评,API 成本不低但无需训练与专用算力。主要复现风险是模型版本更替与 LLM 评委方差;总体难度中等,工程量集中在跑通多套骨架与任务会话管理。
论文图表
示意图展示开放式科研任务的隐含需求结构:指令只给出高层目标(例如综合多种观测度量全球冰川物质损失),而成功所需的分析、方法与证据标准是隐式的;智能体在规划与执行中因此出现三类典型失败——遗漏关键分析、使用错误流程、得出缺乏证据支撑的结论。
一图点明全文动机:失败源于任务欠规约而非执行能力不足,为把隐含需求显式化为可执行量表的核心方案铺垫。