PaperGym:面向科研计划生成的评分标准中心进化框架 PaperGym: Rubric-Centered Evolution for Research-Plan Generation
把每篇论文改造成可验证训练环境,双阶段利用评分标准进化科研计划生成能力
前置知识
可验证奖励强化学习(RLVR)
一种后训练范式:每个任务都配有可自动核查的答案或判据(如数学答案、单元测试),训练时据此给候选解打分并优化策略。它依赖任务与评审成对出现的环境,数学和代码因天然可验证而进展最快;而科研计划这类开放任务没有标准答案,专家评审又无法支撑训练规模的反馈,是该范式难以直接迁移的领域。
本文的全部动机就是把研究论文改造成RLVR所要求的环境:问题当任务、评分标准当评审,理解这一范式才能看懂框架设计的出发点。
GRPO(组相对策略优化)
一种无需学习价值网络的策略优化算法:对同一问题采样一组(本文为8个)回答,用组内奖励的均值和方差把每个回答的奖励标准化为优势,再以裁剪概率比率目标更新策略,并加KL惩罚防止偏离参考策略过远。其奖励是序列级标量,对所有token一视同仁。
论文第二阶段用GRPO消费评分标准产出的奖励,理解其组内标准化与裁剪目标,才能明白评分标准的信息为何会在这一步被压缩。
在策略自蒸馏(OPSD)
同一个模型兼任教师与学生:教师额外看到参考答案(本文中是评分标准)作为特权信息,对学生的on-policy rollout前缀给出下一token分布;学生逐token最小化与教师分布的Jensen-Shannon散度。它把稀疏的结果级信号转成稠密的token级指导,但教师条件的特权信息若使用不当会导致学生过拟合。
本文第一阶段把评分标准作为教师的特权上下文来构建宽先验,OPSD的机制与其约200步后过拟合回落的现象,是理解两阶段次序设计的前提。
评分标准即奖励(Rubric-as-Rewards)
把回答质量分解为若干条针对具体问题的原子判据(rubric),由LLM判官逐条给出二元判定后聚合成分数作为奖励。相比单一整体打分更可解释、更细粒度,但每个rollout需要多次判官调用,且存在判官盲区带来的奖励黑客风险。
本文的数据构造(每题10条实例级标准加通用标准)与奖励公式 $r_i=\alpha r_{i,\text{spec}}+(1-\alpha)r_{i,\text{gen}}$ 都建立在这一范式之上。
评分标准泄漏(criterion leakage)
指评分标准的内容可以直接从任务问题本身推断出来的程度。若标准复述了问题中已有的信息,模型只需改写问题就能刷高奖励,训练信号随之失效。论文用LLM判断每条标准能否仅凭问题推出,以可推断标准的比例来量化泄漏。
泄漏率是全文的核心证据:现有数据集为11.90%到34.10%,PaperGym降到3.73%,这一指标直接衡量数据贡献的大小。
LoRA 低秩适配
参数高效微调方法:冻结原模型权重,只训练注入到注意力等层旁路的低秩矩阵,由秩 $r$ 和缩放系数 $\alpha$ 控制,通常配合bf16混合精度使用,大幅降低显存与算力需求,使中等规模显卡也能微调数B到数十B参数的模型。
OPSD阶段即用 $r=64,\alpha=128$ 的LoRA微调,这是理解实验实现细节与算力开销估计的必要背景。
研究动机
科研计划是AI科学家的决定性能力,但一份计划没有可对照的标准答案,专家评审又无法支撑训练规模的反馈,强化学习因此缺少任务与评审成套的训练环境。已有工作从论文中提取研究目标并配评分标准作为奖励,但问题与标准取自同一部分内容,模型靠复述问题就能骗取奖励:作者测得现有数据集的评分标准泄漏率在11.90%(HealthBench)到34.10%(ResearchPlanGen-ArXiv)之间,其中RubricHub Science为17.39%、ResearchPlanGen-ML为31.29%、ResearchQA为19.22%。此外,判官对每条标准逐一判定后,反馈被压缩成每个rollout一个标量,细粒度监督大量浪费;现有实例级标准几乎只覆盖方法维度,实验设计只能靠全量共享的通用守则兜底。而SFT模仿唯一参考答案会收窄输出分布,在Qwen3-8B上五基准平均反而下降0.96分。
本文的目标是本文的目标是把单篇研究论文变成一个完整、可直接用于强化学习的训练环境:任务来自问题,评审来自评分标准,两者来源严格分离。具体包括三件事:其一,构建一条数据流水线,从arXiv论文合成与答案解耦的研究问题,并为每题生成同时考察方法创新与实验设计两个维度的10条原子二元标准,把标准泄漏率压到3.7%;其二,产出两万实例语料PaperGym-20k(计算机科学约50%、物理约25%、经济约25%)以及两个保留基准PaperGym-Innov与PaperGym-Design;其三,设计两阶段训练方案,让同一份评分标准被使用两次,先当自蒸馏教师的特权上下文,再当GRPO的奖励,并在Qwen3-1.7B/4B/8B三个规模上验证其相对SFT、单阶段方案及反向次序的优势。
与已有工作不同的是,独特切入在于利用论文自身的章节结构来拆分信息源:问题只从研究目标与背景合成,参考答案只从研究方法与实验设计提取,从源头切断标准与问题的重合,而不像Goel等人的流水线、DEEPINNOVATOR、EvoIdeator那样不区分结构地从同一内容生成问答对。另一处差异是对评分标准的使用方式:以往工作要么把它压缩成单个奖励标量(纯序列级监督),要么只做标准条件化自蒸馏(从不检查生成计划是否达标,且会过拟合特权上下文)。PaperGym让同一份标准先提供稠密的token级先验、后提供结果级奖励,形成先发散后收敛的分布进化路线,同时回应了Rubric-as-Rewards范式中稀疏标量奖励与特权信息泄漏两个瓶颈。
核心方法
直觉上,一篇论文天然包含问题与合格解两半,PaperGym把它们拆开再重新组装成训练环境。技术路线分两段:数据生成阶段先把arXiv论文的LaTeX源码按章节用map-reduce方式抽取成研究目标、背景、研究方法、实验设计四个阶段(抽取与合并用Qwen3-235B-A22B完成),再从目标加背景合成研究问题、从方法加实验设计合成参考答案;随后用DeepSeek-V4-Flash生成题目条件化标准与答案落地标准,合并去重、按重要性排序保留前10条,加上沿用Goel等人的通用标准,构成每题约20条二元评分标准。训练阶段先用标准条件化OPSD建立宽先验:学生只看问题做on-policy rollout,教师额外看到标准,学生逐token最小化与教师的Jensen-Shannon散度;再用GRPO对完整计划按标准逐条判分,以 $\alpha=0.7$ 加权专业化与通用得分作为奖励优化策略。
核心创新是把评分标准从一次性标量变成贯穿两阶段的进化信号,并用论文结构保证标准不可从问题推断。与已有方法的本质区别有三点:其一,问题与答案来自论文不相交的章节,标准泄漏率从现有数据集的11.90%到34.10%降到3.73%(PaperGym-Innov 4.71%、PaperGym-Design 4.97%),复述问题不再能刷分;其二,标准同时覆盖方法创新与实验设计双维度(63.8%对准方法、36.2%对准实验),而现有实例级标准几乎只查方法;其三,OPSD阶段教师以标准为特权信息,标准枚举的是评估原则而非唯一答案,因此保留比答案条件化蒸馏更宽的合法计划集合,为第二阶段GRPO提供结构良好的宽先验。消融显示去掉任一标准来源或维度都会掉分,验证了各设计互补而非冗余。
方法步骤详情
第一步预处理:arXiv论文LaTeX源码按章节切分,用Qwen3-235B-A22B逐节抽取(map)、按阶段合并去重(reduce),得到研究目标、背景、研究方法、实验设计四段,实验设计剔除具体数值以防背题。第二步构造:研究问题由目标加背景合成,参考答案由方法加实验设计合成,来源章节不相交。第三步标准生成:DeepSeek-V4-Flash沿方法创新与实验设计两个维度,分别从仅看问题的 $R_Q$ 和看问题加答案的 $R_A$ 各生成10条候选,合并去重按重要性留前10条,另配通用标准。第四步OPSD:最小化 $\mathcal{L}_{\text{OPSD}}$,即学生rollout与标准条件化教师之间的逐token Jensen-Shannon散度,LoRA $r=64,\alpha=128$、学习率 $5\times10^{-6}$,1.7B/4B各200步、8B 400步。第五步GRPO:冻结的基础模型副本按标准逐条二元判分,奖励 $r_i=\alpha\,r_{i,\text{spec}}+(1-\alpha)\,r_{i,\text{gen}}$($\alpha=0.7$),组内标准化后以裁剪概率比率目标更新,每题采8个回答,KL惩罚0.01、学习率 $1\times10^{-5}$,1.7B/4B各200步、8B 100步。
技术新颖性
与最近邻工作的对比最能说明新颖性。Goel等人2025年开创标准驱动RL,DEEPINNOVATOR与EvoIdeator跟进变体奖励设计,但都停留在序列级标量监督,且问答对同源导致11.90%到34.10%的泄漏;本文用结构化四阶段抽取在源头解耦,泄漏降至3.73%,约低3到9倍。Gu等与Rezaei等把稀疏标准奖励转成OPSD式token级监督,但蒸馏从不校验生成计划是否达标,且会过拟合特权上下文(OPSD单独使用约200步后性能回落);本文把标准校验留到GRPO阶段,且实验证明OPSD先行优于GRPO先行,两阶段次序本身即是贡献。数据侧还给出双维度标准与创新、设计双来源的系统性消融:仅用 $R_Q$ 掉0.97/0.21分、仅用 $R_A$ 掉1.87/1.11分,换弱模型生成标准掉2.00分而换弱抽取器仅掉0.97分,证明标准质量才是数据管线的真正瓶颈。
实验结果
主结果(Table 1):两阶段方案在三个规模全部最优,Qwen3-8B五基准平均从33.74升至38.55(+4.81),其中ResearchQA从66.65升至73.48,超过远大于己的Kimi K2.6(73.19)与S1-VL-RL(72.09);1.7B与4B分别提升+5.56和+5.04。SFT在8B上反而降0.96分;单用OPSD(35.84)与单用GRPO(35.86)持平,叠加后显著更优。领域内基准上,8B模型PaperGym-Innov得24.47,远超Intern-S1-Mini的7.48与Rebicon-Preview的20.88;PaperGym-Design得21.88,超过二者的4.48与20.42,但距GPT-5.1等最强闭源模型仍有差距。数据质量隔离(Table 2):同一训练配方下,PaperGym-20k训练版在ResearchPlanGen-ML三方对比中Overall Score胜率58.1%,高于RubricHub Science训练版的28.2%与未训练基线的13.7%。扩展律(Figure 3左):数据从0.5k增至15k,Qwen3-4B在PaperGym-Innov从16.12升至19.21、Design从13.89升至16.96。泄漏测量(Table 3):PaperGym-20k为3.73%,对照现有数据集的11.90%到34.10%。消融(Table 4):仅用 $R_Q$ 掉0.97/0.21分、仅用 $R_A$ 掉1.87/1.11分,验证双来源双维度互补。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| ResearchQA(域外基准,Qwen3-8B) | rubric覆盖率分数 | 73.48 | 未训练基线 66.65;Kimi K2.6 73.19;S1-VL-RL 72.09 | 较基线 +6.83,小幅超过 Kimi K2.6 与 S1-VL-RL |
| 五基准平均(Qwen3-8B,OPSD+GRPO) | 五基准平均分 | 38.55 | 33.74(未训练);35.84(仅OPSD);35.86(仅GRPO) | +4.81,且明显超过任一单阶段方案 |
| 五基准平均(Qwen3-1.7B / 4B) | 五基准平均分 | 27.81 / 34.76 | 22.24 / 29.72(各自未训练基线) | +5.56 / +5.04 |
| PaperGym-Innov(Qwen3-8B) | 创新维度rubric覆盖率 | 24.47 | Intern-S1-Mini 7.48;Rebicon-Preview 20.88;GPT-5.1 36.59 | 较科学专用模型最高 +16.99 |
| PaperGym-Design(Qwen3-8B) | 设计维度rubric覆盖率 | 21.88 | Intern-S1-Mini 4.48;Rebicon-Preview 20.42;Claude-Sonnet-5 39.63 | 较Intern-S1-Mini +17.40,较Rebicon-Preview +1.46 |
| ResearchPlanGen-ML 三方胜率(Overall Score) | LLM判官三方胜率(%) | 58.1(PaperGym-20k 训练) | RubricHub Science 训练 28.2;未训练 Qwen3-1.7B 13.7 | +29.9 个百分点,证明优势来自数据本身 |
| 评分标准泄漏率(PaperGym-20k) | 可从问题直接推断的标准比例 | 3.73%(Innov 4.71%,Design 4.97%) | HealthBench 11.90%;RubricHub Science 17.39%;ResearchPlanGen-ArXiv 34.10% | 约为现有数据集的 1/3 到 1/9 |
局限与改进
作者未设独立局限章节,从文本可提炼如下:其一,泄漏率虽降至3.73%到4.97%,但并不为零,复述捷径未被根除;其二,评分依赖LLM判官,Qwen3-8B与Kimi K2.6在二元判定上仅约80%一致,训练信号带噪,且4B/8B模型自评可能存在偏好自身风格的盲区;其三,实际训练只用PaperGym-20k的计算机科学子集约1万条,物理与经济仅有基准评测、训练收益未单独验证;其四,绝对分数仍然偏低,PaperGym-Innov最佳24.47、PaperGym-Design 21.88,与GPT-5.1(36.59/34.11)和Claude-Sonnet-5(36.17/39.63)相比在领域内基准上仍有明显差距,所谓超越Kimi K2.6主要体现在ResearchQA单点;其五,GRPO阶段每条回答要对约20条标准逐一判分,判官推理成本高;其六,OPSD单独使用约200步后过拟合特权上下文回落,蒸馏阶段实际需要早停或与GRPO绑定使用。
独立分析的弱点
弱点一:判官瓶颈与奖励黑客。奖励由冻结的基础模型自评产生,逐条二元判定既昂贵又可能被钻空子——模型或学会写看起来覆盖标准的套话而非真正的科学计划,论文未报告对抗性探测。改进方向是引入异构判官集成或人类专家抽检校准。弱点二:二元标准过粗,无法区分部分正确的中间质量;加权系数 $\alpha=0.7$ 虽有敏感性分析但仍是经验取值,可探索等级化标准或学习到的权重。弱点三:领域覆盖偏向计算机科学(语料约50%为CS,训练又只用CS子集),物理与经济只有评测、生物医学等高风险领域未涉及,改进方向是分域训练并验证跨域迁移。弱点四:泄漏度量本身依赖DeepSeek-V4-Flash的判断,能否从问题推断的判定可能低估隐性泄漏(如问题措辞暗示方法风格),应补充人工泄漏审计。弱点五:与最强闭源模型相比,新构建基准上的绝对差距仍大,方法能否弥合而非仅缩小差距存疑。
未来方向
作者提出的方向之外,可延伸的路有:一是把评分标准从结果级推向过程级,对计划中的假设、方法、实验链条逐段判分,实现更细的信用分配,甚至把逐条判定结果转化为token级奖励塑形而非组内标量;二是把PaperGym环境接入完整的AI科学家agent闭环,让计划生成与执行反馈互相驱动、迭代进化;三是扩展到实验可执行领域(如ML实验、代码科研),用真实运行结果替代LLM判官,从根上消除判官噪声与奖励黑客;四是深入研究标准质量与模型规模的关系,消融显示换标准生成器掉2.00分而换抽取器仅掉0.97分,可用更强推理模型或委员会投票进一步提升标准质量;五是检验两阶段次序在非Qwen系架构与MoE模型上的普适性,并为OPSD的特权上下文过拟合设计自动早停准则;六是把泄漏率推广为数据集审计的标准指标,建立科研基准的泄漏披露规范。
复现评估
复现条件较好:作者承诺开源数据流水线、PaperGym-20k语料与PaperGym-Innov、PaperGym-Design两个基准,项目页为zju-real.github.io/PaperGym,代码在github.com/ZJU-REAL/PaperGym。算力门槛中等:Qwen3-1.7B与4B用4张48GB A6000,8B用4张96GB Pro A6000,均以bf16加LoRA训练;OPSD阶段200到400步、GRPO阶段100到200步,配合verl框架与vLLM采样,小型实验室可完成缩小规模复现。难点有二:数据管线依赖Qwen3-235B-A22B做四阶段抽取、DeepSeek-V4-Flash做标准生成与最终判分,需要可观的API额度;评测还涉及ResearchQA、ResearchPlanGen-ML、RubricHub Science等外部基准的获取与判官协议对齐。总体属于数据重生成偏难、训练复现中等、评测对齐需细心的可复现级别。
论文图表