← 返回 2026-09-01

PaperGym:面向科研计划生成的评分标准中心进化框架 PaperGym: Rubric-Centered Evolution for Research-Plan Generation

Yuhan Wang, Zhengxi Lu, Yuchen Yan, Kaitao Song, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen 📅 2026-08-31 👍 34 2026-09-01 18:30
LLM后训练 强化学习 数据集构建 科研计划生成 自蒸馏 评分标准奖励

把每篇论文改造成可验证训练环境,双阶段利用评分标准进化科研计划生成能力

前置知识

可验证奖励强化学习(RLVR)

一种后训练范式:每个任务都配有可自动核查的答案或判据(如数学答案、单元测试),训练时据此给候选解打分并优化策略。它依赖任务与评审成对出现的环境,数学和代码因天然可验证而进展最快;而科研计划这类开放任务没有标准答案,专家评审又无法支撑训练规模的反馈,是该范式难以直接迁移的领域。

本文的全部动机就是把研究论文改造成RLVR所要求的环境:问题当任务、评分标准当评审,理解这一范式才能看懂框架设计的出发点。

GRPO(组相对策略优化)

一种无需学习价值网络的策略优化算法:对同一问题采样一组(本文为8个)回答,用组内奖励的均值和方差把每个回答的奖励标准化为优势,再以裁剪概率比率目标更新策略,并加KL惩罚防止偏离参考策略过远。其奖励是序列级标量,对所有token一视同仁。

论文第二阶段用GRPO消费评分标准产出的奖励,理解其组内标准化与裁剪目标,才能明白评分标准的信息为何会在这一步被压缩。

在策略自蒸馏(OPSD)

同一个模型兼任教师与学生:教师额外看到参考答案(本文中是评分标准)作为特权信息,对学生的on-policy rollout前缀给出下一token分布;学生逐token最小化与教师分布的Jensen-Shannon散度。它把稀疏的结果级信号转成稠密的token级指导,但教师条件的特权信息若使用不当会导致学生过拟合。

本文第一阶段把评分标准作为教师的特权上下文来构建宽先验,OPSD的机制与其约200步后过拟合回落的现象,是理解两阶段次序设计的前提。

评分标准即奖励(Rubric-as-Rewards)

把回答质量分解为若干条针对具体问题的原子判据(rubric),由LLM判官逐条给出二元判定后聚合成分数作为奖励。相比单一整体打分更可解释、更细粒度,但每个rollout需要多次判官调用,且存在判官盲区带来的奖励黑客风险。

本文的数据构造(每题10条实例级标准加通用标准)与奖励公式 $r_i=\alpha r_{i,\text{spec}}+(1-\alpha)r_{i,\text{gen}}$ 都建立在这一范式之上。

评分标准泄漏(criterion leakage)

指评分标准的内容可以直接从任务问题本身推断出来的程度。若标准复述了问题中已有的信息,模型只需改写问题就能刷高奖励,训练信号随之失效。论文用LLM判断每条标准能否仅凭问题推出,以可推断标准的比例来量化泄漏。

泄漏率是全文的核心证据:现有数据集为11.90%到34.10%,PaperGym降到3.73%,这一指标直接衡量数据贡献的大小。

LoRA 低秩适配

参数高效微调方法:冻结原模型权重,只训练注入到注意力等层旁路的低秩矩阵,由秩 $r$ 和缩放系数 $\alpha$ 控制,通常配合bf16混合精度使用,大幅降低显存与算力需求,使中等规模显卡也能微调数B到数十B参数的模型。

OPSD阶段即用 $r=64,\alpha=128$ 的LoRA微调,这是理解实验实现细节与算力开销估计的必要背景。

研究动机

科研计划是AI科学家的决定性能力,但一份计划没有可对照的标准答案,专家评审又无法支撑训练规模的反馈,强化学习因此缺少任务与评审成套的训练环境。已有工作从论文中提取研究目标并配评分标准作为奖励,但问题与标准取自同一部分内容,模型靠复述问题就能骗取奖励:作者测得现有数据集的评分标准泄漏率在11.90%(HealthBench)到34.10%(ResearchPlanGen-ArXiv)之间,其中RubricHub Science为17.39%、ResearchPlanGen-ML为31.29%、ResearchQA为19.22%。此外,判官对每条标准逐一判定后,反馈被压缩成每个rollout一个标量,细粒度监督大量浪费;现有实例级标准几乎只覆盖方法维度,实验设计只能靠全量共享的通用守则兜底。而SFT模仿唯一参考答案会收窄输出分布,在Qwen3-8B上五基准平均反而下降0.96分。

本文的目标是本文的目标是把单篇研究论文变成一个完整、可直接用于强化学习的训练环境:任务来自问题,评审来自评分标准,两者来源严格分离。具体包括三件事:其一,构建一条数据流水线,从arXiv论文合成与答案解耦的研究问题,并为每题生成同时考察方法创新与实验设计两个维度的10条原子二元标准,把标准泄漏率压到3.7%;其二,产出两万实例语料PaperGym-20k(计算机科学约50%、物理约25%、经济约25%)以及两个保留基准PaperGym-Innov与PaperGym-Design;其三,设计两阶段训练方案,让同一份评分标准被使用两次,先当自蒸馏教师的特权上下文,再当GRPO的奖励,并在Qwen3-1.7B/4B/8B三个规模上验证其相对SFT、单阶段方案及反向次序的优势。

与已有工作不同的是,独特切入在于利用论文自身的章节结构来拆分信息源:问题只从研究目标与背景合成,参考答案只从研究方法与实验设计提取,从源头切断标准与问题的重合,而不像Goel等人的流水线、DEEPINNOVATOR、EvoIdeator那样不区分结构地从同一内容生成问答对。另一处差异是对评分标准的使用方式:以往工作要么把它压缩成单个奖励标量(纯序列级监督),要么只做标准条件化自蒸馏(从不检查生成计划是否达标,且会过拟合特权上下文)。PaperGym让同一份标准先提供稠密的token级先验、后提供结果级奖励,形成先发散后收敛的分布进化路线,同时回应了Rubric-as-Rewards范式中稀疏标量奖励与特权信息泄漏两个瓶颈。

核心方法

直觉上,一篇论文天然包含问题与合格解两半,PaperGym把它们拆开再重新组装成训练环境。技术路线分两段:数据生成阶段先把arXiv论文的LaTeX源码按章节用map-reduce方式抽取成研究目标、背景、研究方法、实验设计四个阶段(抽取与合并用Qwen3-235B-A22B完成),再从目标加背景合成研究问题、从方法加实验设计合成参考答案;随后用DeepSeek-V4-Flash生成题目条件化标准与答案落地标准,合并去重、按重要性排序保留前10条,加上沿用Goel等人的通用标准,构成每题约20条二元评分标准。训练阶段先用标准条件化OPSD建立宽先验:学生只看问题做on-policy rollout,教师额外看到标准,学生逐token最小化与教师的Jensen-Shannon散度;再用GRPO对完整计划按标准逐条判分,以 $\alpha=0.7$ 加权专业化与通用得分作为奖励优化策略。

核心创新是把评分标准从一次性标量变成贯穿两阶段的进化信号,并用论文结构保证标准不可从问题推断。与已有方法的本质区别有三点:其一,问题与答案来自论文不相交的章节,标准泄漏率从现有数据集的11.90%到34.10%降到3.73%(PaperGym-Innov 4.71%、PaperGym-Design 4.97%),复述问题不再能刷分;其二,标准同时覆盖方法创新与实验设计双维度(63.8%对准方法、36.2%对准实验),而现有实例级标准几乎只查方法;其三,OPSD阶段教师以标准为特权信息,标准枚举的是评估原则而非唯一答案,因此保留比答案条件化蒸馏更宽的合法计划集合,为第二阶段GRPO提供结构良好的宽先验。消融显示去掉任一标准来源或维度都会掉分,验证了各设计互补而非冗余。

方法步骤详情

第一步预处理:arXiv论文LaTeX源码按章节切分,用Qwen3-235B-A22B逐节抽取(map)、按阶段合并去重(reduce),得到研究目标、背景、研究方法、实验设计四段,实验设计剔除具体数值以防背题。第二步构造:研究问题由目标加背景合成,参考答案由方法加实验设计合成,来源章节不相交。第三步标准生成:DeepSeek-V4-Flash沿方法创新与实验设计两个维度,分别从仅看问题的 $R_Q$ 和看问题加答案的 $R_A$ 各生成10条候选,合并去重按重要性留前10条,另配通用标准。第四步OPSD:最小化 $\mathcal{L}_{\text{OPSD}}$,即学生rollout与标准条件化教师之间的逐token Jensen-Shannon散度,LoRA $r=64,\alpha=128$、学习率 $5\times10^{-6}$,1.7B/4B各200步、8B 400步。第五步GRPO:冻结的基础模型副本按标准逐条二元判分,奖励 $r_i=\alpha\,r_{i,\text{spec}}+(1-\alpha)\,r_{i,\text{gen}}$($\alpha=0.7$),组内标准化后以裁剪概率比率目标更新,每题采8个回答,KL惩罚0.01、学习率 $1\times10^{-5}$,1.7B/4B各200步、8B 100步。

技术新颖性

与最近邻工作的对比最能说明新颖性。Goel等人2025年开创标准驱动RL,DEEPINNOVATOR与EvoIdeator跟进变体奖励设计,但都停留在序列级标量监督,且问答对同源导致11.90%到34.10%的泄漏;本文用结构化四阶段抽取在源头解耦,泄漏降至3.73%,约低3到9倍。Gu等与Rezaei等把稀疏标准奖励转成OPSD式token级监督,但蒸馏从不校验生成计划是否达标,且会过拟合特权上下文(OPSD单独使用约200步后性能回落);本文把标准校验留到GRPO阶段,且实验证明OPSD先行优于GRPO先行,两阶段次序本身即是贡献。数据侧还给出双维度标准与创新、设计双来源的系统性消融:仅用 $R_Q$ 掉0.97/0.21分、仅用 $R_A$ 掉1.87/1.11分,换弱模型生成标准掉2.00分而换弱抽取器仅掉0.97分,证明标准质量才是数据管线的真正瓶颈。

Overview of the PaperGym framework. (a) Data Generation: arXiv papers are parsed into four stages to synthesize questions and answers; rubrics are generated, merged, ranked, and filtered. (b) Two-Stage Policy Training: rubric-based OPSD followed by rubric-as-rewards GRPO.
Figure 1: Overview of the PaperGym framework. (a) Data Generation: arXiv papers are parsed into four stages to synthesize questions and answers; rubrics are generated, merged, ranked, and filtered. (b) Two-Stage Policy Training: rubric-based OPSD followed by rubric-as-rewards GRPO.
Preliminary analysis. Left: Category breakdown of PaperGym-20k across three domains. Middle: Mean score vs. across-round range for four scoring models over five independent runs. Right: Pairwise inter-model agreement on binary rubric verdicts.
Figure 2: Preliminary analysis. Left: Category breakdown of PaperGym-20k across three domains. Middle: Mean score vs. across-round range for four scoring models over five independent runs. Right: Pairwise inter-model agreement on binary rubric verdicts.

实验结果

主结果(Table 1):两阶段方案在三个规模全部最优,Qwen3-8B五基准平均从33.74升至38.55(+4.81),其中ResearchQA从66.65升至73.48,超过远大于己的Kimi K2.6(73.19)与S1-VL-RL(72.09);1.7B与4B分别提升+5.56和+5.04。SFT在8B上反而降0.96分;单用OPSD(35.84)与单用GRPO(35.86)持平,叠加后显著更优。领域内基准上,8B模型PaperGym-Innov得24.47,远超Intern-S1-Mini的7.48与Rebicon-Preview的20.88;PaperGym-Design得21.88,超过二者的4.48与20.42,但距GPT-5.1等最强闭源模型仍有差距。数据质量隔离(Table 2):同一训练配方下,PaperGym-20k训练版在ResearchPlanGen-ML三方对比中Overall Score胜率58.1%,高于RubricHub Science训练版的28.2%与未训练基线的13.7%。扩展律(Figure 3左):数据从0.5k增至15k,Qwen3-4B在PaperGym-Innov从16.12升至19.21、Design从13.89升至16.96。泄漏测量(Table 3):PaperGym-20k为3.73%,对照现有数据集的11.90%到34.10%。消融(Table 4):仅用 $R_Q$ 掉0.97/0.21分、仅用 $R_A$ 掉1.87/1.11分,验证双来源双维度互补。

Main results across model scales and training strategies. Subscripts denote changes relative to the corresponding base model.
Table 1: Main results across model scales and training strategies. Subscripts denote changes relative to the corresponding base model.
Win Rate Results. For each criterion, we report the percentage of comparisons in which each model is selected as the best among the baseline trained on PaperGym-20k, the baseline trained on RubricHub Science, and the untrained Qwen3-1.7B by an LLM judge.
Table 2: Win Rate Results. For each criterion, we report the percentage of comparisons in which each model is selected as the best among the baseline trained on PaperGym-20k, the baseline trained on RubricHub Science, and the untrained Qwen3-1.7B by an LLM judge.
Criterion leakage comparison.
Table 3: Criterion leakage comparison.
Ablation on data construction pipeline.
Table 4: Ablation on data construction pipeline.
Left: Data scaling law with GRPO training. Right: Training dynamics across two-stage orderings of OPSD and GRPO on Qwen3-1.7B.
Figure 3: Left: Data scaling law with GRPO training. Right: Training dynamics across two-stage orderings of OPSD and GRPO on Qwen3-1.7B.
Entropy dynamics under different training strategies.
Figure 4: Entropy dynamics under different training strategies.
查看结构化数据
任务指标本文基线提升
ResearchQA(域外基准,Qwen3-8B) rubric覆盖率分数 73.48 未训练基线 66.65;Kimi K2.6 73.19;S1-VL-RL 72.09 较基线 +6.83,小幅超过 Kimi K2.6 与 S1-VL-RL
五基准平均(Qwen3-8B,OPSD+GRPO) 五基准平均分 38.55 33.74(未训练);35.84(仅OPSD);35.86(仅GRPO) +4.81,且明显超过任一单阶段方案
五基准平均(Qwen3-1.7B / 4B) 五基准平均分 27.81 / 34.76 22.24 / 29.72(各自未训练基线) +5.56 / +5.04
PaperGym-Innov(Qwen3-8B) 创新维度rubric覆盖率 24.47 Intern-S1-Mini 7.48;Rebicon-Preview 20.88;GPT-5.1 36.59 较科学专用模型最高 +16.99
PaperGym-Design(Qwen3-8B) 设计维度rubric覆盖率 21.88 Intern-S1-Mini 4.48;Rebicon-Preview 20.42;Claude-Sonnet-5 39.63 较Intern-S1-Mini +17.40,较Rebicon-Preview +1.46
ResearchPlanGen-ML 三方胜率(Overall Score) LLM判官三方胜率(%) 58.1(PaperGym-20k 训练) RubricHub Science 训练 28.2;未训练 Qwen3-1.7B 13.7 +29.9 个百分点,证明优势来自数据本身
评分标准泄漏率(PaperGym-20k) 可从问题直接推断的标准比例 3.73%(Innov 4.71%,Design 4.97%) HealthBench 11.90%;RubricHub Science 17.39%;ResearchPlanGen-ArXiv 34.10% 约为现有数据集的 1/3 到 1/9

局限与改进

作者未设独立局限章节,从文本可提炼如下:其一,泄漏率虽降至3.73%到4.97%,但并不为零,复述捷径未被根除;其二,评分依赖LLM判官,Qwen3-8B与Kimi K2.6在二元判定上仅约80%一致,训练信号带噪,且4B/8B模型自评可能存在偏好自身风格的盲区;其三,实际训练只用PaperGym-20k的计算机科学子集约1万条,物理与经济仅有基准评测、训练收益未单独验证;其四,绝对分数仍然偏低,PaperGym-Innov最佳24.47、PaperGym-Design 21.88,与GPT-5.1(36.59/34.11)和Claude-Sonnet-5(36.17/39.63)相比在领域内基准上仍有明显差距,所谓超越Kimi K2.6主要体现在ResearchQA单点;其五,GRPO阶段每条回答要对约20条标准逐一判分,判官推理成本高;其六,OPSD单独使用约200步后过拟合特权上下文回落,蒸馏阶段实际需要早停或与GRPO绑定使用。

独立分析的弱点

弱点一:判官瓶颈与奖励黑客。奖励由冻结的基础模型自评产生,逐条二元判定既昂贵又可能被钻空子——模型或学会写看起来覆盖标准的套话而非真正的科学计划,论文未报告对抗性探测。改进方向是引入异构判官集成或人类专家抽检校准。弱点二:二元标准过粗,无法区分部分正确的中间质量;加权系数 $\alpha=0.7$ 虽有敏感性分析但仍是经验取值,可探索等级化标准或学习到的权重。弱点三:领域覆盖偏向计算机科学(语料约50%为CS,训练又只用CS子集),物理与经济只有评测、生物医学等高风险领域未涉及,改进方向是分域训练并验证跨域迁移。弱点四:泄漏度量本身依赖DeepSeek-V4-Flash的判断,能否从问题推断的判定可能低估隐性泄漏(如问题措辞暗示方法风格),应补充人工泄漏审计。弱点五:与最强闭源模型相比,新构建基准上的绝对差距仍大,方法能否弥合而非仅缩小差距存疑。

未来方向

作者提出的方向之外,可延伸的路有:一是把评分标准从结果级推向过程级,对计划中的假设、方法、实验链条逐段判分,实现更细的信用分配,甚至把逐条判定结果转化为token级奖励塑形而非组内标量;二是把PaperGym环境接入完整的AI科学家agent闭环,让计划生成与执行反馈互相驱动、迭代进化;三是扩展到实验可执行领域(如ML实验、代码科研),用真实运行结果替代LLM判官,从根上消除判官噪声与奖励黑客;四是深入研究标准质量与模型规模的关系,消融显示换标准生成器掉2.00分而换抽取器仅掉0.97分,可用更强推理模型或委员会投票进一步提升标准质量;五是检验两阶段次序在非Qwen系架构与MoE模型上的普适性,并为OPSD的特权上下文过拟合设计自动早停准则;六是把泄漏率推广为数据集审计的标准指标,建立科研基准的泄漏披露规范。

复现评估

复现条件较好:作者承诺开源数据流水线、PaperGym-20k语料与PaperGym-Innov、PaperGym-Design两个基准,项目页为zju-real.github.io/PaperGym,代码在github.com/ZJU-REAL/PaperGym。算力门槛中等:Qwen3-1.7B与4B用4张48GB A6000,8B用4张96GB Pro A6000,均以bf16加LoRA训练;OPSD阶段200到400步、GRPO阶段100到200步,配合verl框架与vLLM采样,小型实验室可完成缩小规模复现。难点有二:数据管线依赖Qwen3-235B-A22B做四阶段抽取、DeepSeek-V4-Flash做标准生成与最终判分,需要可观的API额度;评测还涉及ResearchQA、ResearchPlanGen-ML、RubricHub Science等外部基准的获取与判官协议对齐。总体属于数据重生成偏难、训练复现中等、评测对齐需细心的可复现级别。