← 返回 2026-09-11

ActReview:反驳引导的训练数据与量规奖励驱动的可操作同行评审生成 ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation

Yiling Ma, Yilun Zhao, Sihong Wu, Ziyu Chen, Manasi Patwardhan, Arman Cohan 📅 2026-09-08 👍 12 2026-09-12 18:30
GRPO强化学习 LLM-as-a-Judge LLM后训练 同行评审 数据构建

把审稿-反驳交互当作潜在监督,训练出能诊断弱点并给出可执行修改建议的评审模型

前置知识

Review–Rebuttal(审稿-反驳线程)

OpenReview 等平台上会议投稿的公开评审流程:审稿人给出 weakness(弱点意见),作者随后提交 rebuttal(反驳/回应),说明如何补充实验、澄清误解或修订论文。这一来一回的讨论记录蕴含了「问题—解决方案」的自然配对信号。

本文的全部数据构建与监督信号设计都建立在审稿-反驳线程之上:作者的核心洞察是 rebuttal 揭示了回应审稿关切的合理行动路径,可作为修改建议的潜在监督来源。

GRPO(Group Relative Policy Optimization)

一种面向 LLM 的强化学习算法:对同一 prompt 采样一组 $K$ 个回答,以组内平均奖励作为基线计算相对优势,从而省去训练价值网络;通常配合 KL 正则把策略约束在参考模型附近。DeepSeek-R1 等工作使其广为人知。

本文第二阶段训练即用 GRPO 优化 Qwen3-8B:每个 prompt 采样 $K=8$ 个候选回答,按离线构建的量规打分后做组相对策略更新,得到 ActReview-RL。

Rubric Reward(量规奖励)

对不可精确验证的开放式任务(如写评审意见),用结构化评分标准代替单一标量偏好:先定义硬约束(违反即零分),再定义若干加权软性指标,可用确定性规则与 LLM 评审共同打分,从而对输出质量做多维、可解释的衡量。

本文提出 candidate-aware、weakness-specific 的实例级量规:为每条训练样本单独合成评分标准(含硬约束+加权软指标),替代通用任务级量规或直接 LLM 打分,是其 RL 增益的关键来源。

LLM-as-a-Judge

用强模型(如 GPT-5.4)代替人类评估者,对两个系统的输出做成对比较或按维度打分,从而以低成本获得接近人类偏好的规模化评估。需要注意评审模型与被评系统之间的耦合偏差风险。

本文的数据增强、量规合成、语义奖励打分和 1000 实例成对评测全部依赖 GPT-5.4,同时用 200 实例人类评估(一致性 93%)和独立 Claude 评估校验其可靠性。

多任务监督微调(Multi-task SFT)

在监督微调阶段把多个相关任务的样本统一成相同指令格式后混合训练一个模型,使其共享底层能力同时学会各自的输出模式,通常比单独训练每个任务更数据高效、泛化更好。

本文将诊断断言生成(Task 1)与修改建议生成(Task 2)联合训练在 Qwen3-8B-Base 上,消融显示双任务分解比端到端单任务在 Task 2 Overall 上高 0.42 分、断言-建议对齐度高 0.35 分。

研究动机

随着学者们用 LLM 做提交前自审(pre-submission self-review),现有系统的主要缺陷是生成的反馈「描述性有余、规定性不足」:能指出论文哪里有问题(如缺少消融实验、理论动机不足),却说不清该怎么改——在哪个章节补什么实验、修改后预期达成什么效果。具体存在两个缺口:其一,现有评审生成方法大多把它当作单一任务(如 OpenReviewer-8B、DeepReviewer-14B 直接生成完整评审),没有把「问题诊断」与「修改指导」分开建模,导致建议空泛;其二,现有同行评审数据资源主要保留原始评审、分数或反驳讨论,几乎不提供把审稿人识别的弱点与具体修改指导显式关联的参考信号,因此难以评估一条意见究竟是只诊断了问题,还是真正回答了「改什么、在哪改、怎么改」。这在 8B 级开源专用模型上尤其明显:OpenReviewer-8B 在修改建议任务上的证据特异性指标为 0.00,DeepReviewer-14B 也只有 0.00。

本文的目标是本文要解决的核心问题是:如何让 LLM 生成的学术评审反馈从「指出弱点」升级为「可执行的修改方案」。具体目标分三层:第一,把可操作同行评审生成形式化为双任务问题——给定论文上下文 $C$ 和目标弱点标签 $w$,先生成诊断断言集合 $\mathcal{C} = G_{claim}(w, C)$(无证据支撑时应弃答返回空集),再针对每条断言 $c$ 生成修改建议 $r(c)_{action} = G_{action}(c, w, C)$,建议需说明改什么、在哪改、如何实施、预期效果;第二,构建高质量评测基准 ActReview-Bench(1000 个人工策展实例)与大规模训练集 ActReview-40K,用真实 rebuttal 提供有据可依的参考信号;第三,通过两阶段后训练(多任务 SFT + 带量规奖励的 GRPO),让 Qwen3-8B-Base 这个小模型在可操作性与证据接地性上超越此前专用评审生成模型,并与 GPT-5.1、Gemini-3.1-Pro 等强prompt模型保持竞争力。

与已有工作不同的是,本文最独特的切入角度是把作者 rebuttal 当作「潜在监督」信号:作者回应审稿意见时天然揭示了针对某个弱点的合理修改路径,因此可以把「弱点-回应」对齐后改写成初评审风格的诊断断言+修改建议,为训练提供以往数据集缺失的参考答案。与已有的 RbtAct 等利用 rebuttal 的工作相比,本文有三点差异化:一是严格的信息隔离——rebuttal 只在离线数据增强和量规构建时使用,训练与评测输入中绝不出现,避免后见之明泄漏;二是双任务分解加弱点条件化推理,每个实例只针对一个弱点标签查询,使「发现问题」与「规划修改」可分别训练与评估;三是用局部证据检索替代全文输入——为每个弱点检索最相关的论文 chunk 作为上下文,减少噪声并强化监督的聚焦性。

核心方法

整体思路先用直觉理解:一篇好的修改建议从哪来?作者观察到,真实 rebuttal 就是「如何回应审稿弱点」的天然参考答案,因此可以用它反推训练数据。技术上分两条线。数据线:从 OpenReview 收集 ICLR、NeurIPS、EMNLP 的审稿-反驳线程,得到 15,819 篇论文、约 4 万条弱点-回应实例;经原子弱点抽取与标注、弱点-反驳对齐、rebuttal 引导的反馈增强(GPT-5.4 改写)、局部证据检索四步,构建出 ActReview-40K,并配套两级弱点分类体系。训练线:以 Qwen3-8B-Base 为底座,先把 90% 增强实例做多任务 SFT(Task 1 学诊断断言、Task 2 学结构化修改建议,共享统一指令格式);再用剩余 10% 做 GRPO 强化学习——参考答案不直接做监督,而是离线合成每个实例专属的冻结量规(硬约束+加权软指标),每个 prompt 采样 $K=8$ 个候选输出按量规打分,硬约束违反者奖励为零,格式类标准用确定性检查、语义类标准用 GPT-5.4 评分,并加 KL 正则约束策略不偏离 SFT 参考模型太远。

核心创新是「rebuttal 作为潜在监督」的数据构造范式加「候选感知的实例级量规奖励」。与已有工作的本质区别有三:第一,以往系统(DeepReviewer、OpenReviewer)以全文为输入端到端生成评审,本文把任务拆成弱点条件化的诊断与建议两个子任务,Table 6 消融证明这使 Task 2 Overall 从 2.76 提到 3.18(+0.42)、断言-建议对齐从 3.13 提到 3.48(+0.35),说明显式分离诊断与修改规划确实强化了两者联系;第二,rebuttal 只作离线潜监督,改写后的反馈必须是初评审视角、不得提及反驳或提交后的改动,并经自动过滤器清除 rebuttal 泄漏、回溯式改写等问题;第三,通用量规对所有实例用同一标准,无法指出某篇论文具体缺哪块证据、该改哪一节,本文为每条 RL 实例采样多个 SFT 候选输出,联合人写与 GPT-5.4 参考合成实例专属量规,同时捕捉期望修改目标与候选输出的常见失败模式,Table 5 显示其 Task 2 Overall 达 73.4,显著高于固定任务级量规的 61.0 和直接 judge 奖励的 68.7。

方法步骤详情

完整流程七步。第一步,原子弱点抽取与标注:把评审段落分解为只表达一条批评的弱点单元,经 LLM 辅助类目发现与人工精化赋予两级分类标签。第二步,弱点-反驳对齐:先用结构与词汇线索检索候选 rebuttal span,再做 LLM 语义对齐;以 token 级 IoU $\geq 0.5$ 的裁决金标为参照,人工验证 F1 0.94、Cohen's $\kappa=0.85$。第三步,rebuttal 引导的反馈增强:GPT-5.4 为每个对齐样本产出诊断断言与 What/Where/How 修改建议,再自动过滤泄漏等问题,500 条审计显示 $\kappa=0.78$、可接受率 84.8%。第四步,局部证据检索:论文切成带章节元数据的段落级 chunk,Task 1 检索诊断证据,Task 2 经证据支持与修改支持双通道定位 chunk。第五步,多任务 SFT:Task 1 输入弱点标签+chunk 输出断言,Task 2 输入断言+上下文输出建议,90% 数据上全参数微调 Qwen3-8B-Base。第六步,候选感知量规构建:对 10% RL 实例采样多个温度的 SFT 输出,联合人写与 GPT-5.4 参考合成含硬约束与加权软要求的冻结量规。第七步,GRPO:每 prompt 采样 $K=8$ 个回答,硬约束违反记零分,其余按加权软指标求和,组相对更新并加 KL 正则。

技术新颖性

技术新颖性体现在四个层面。数据层面:ActReview-40K 首次把审稿-反驳交互系统性转化为「初评审风格、修改导向」的结构化监督——约 4 万条弱点-回应对经人工验证的对齐(F1 0.94)与增强(可接受率 84.8%),填补了现有评审数据集缺乏「弱点→修改指导」参考信号的空白。检索层面:训练时用弱点条件化的局部 chunk 检索替代全文输入,Table 4 显示 T2 ROUGE-L 反而比全文训练高 0.83(35.50 vs 34.67),同时减少无关上下文,不过附录 F.5 指出跨章节推理类关切全文训练更优(1.49 vs 1.17)。奖励层面:candidate-aware weakness-specific 量规推进了既有通用量规工作——量规不仅来自参考答案,还来自模型自身候选输出的失败模式,且逐实例冻结、训练与评测实例不相交,缓解 judge 耦合。评估层面:ActReview-Bench 提供 1000 个人工双标注加第三方仲裁的实例,用调整胜率(胜 1、平 0.5、负 0)统一 LLM 与人类评估尺度。

Overview of the ActReview framework. From OpenReview's review–rebuttal threads, we construct ActReview-40K and retrieve top-k paper chunks as localized context. The model is first trained via multi-task supervised fine-tuning on Qwen3-8B-Base for claim generation (Task 1) and actionable suggestion generation (Task 2), then further optimized with GRPO using weakness-specific rubrics constructed offline from ground-truth references and diverse candidate outputs scored by an LLM judge.
Figure 1: Overview of the ActReview framework. From OpenReview's review–rebuttal threads, we construct ActReview-40K and retrieve top-k paper chunks as localized context. The model is first trained via multi-task supervised fine-tuning on Qwen3-8B-Base for claim generation (Task 1) and actionable suggestion generation (Task 2), then further optimized with GRPO using weakness-specific rubrics constructed offline from ground-truth references and diverse candidate outputs scored by an LLM judge.
Overview of the ActReview-40K construction pipeline. Starting from real review–rebuttal threads, we build structured training instances through four stages: atomic weakness extraction and labeling, weakness–rebuttal alignment, rebuttal-guided feedback enhancement, and localized evidence retrieval.
Figure 2: Overview of the ActReview-40K construction pipeline. Starting from real review–rebuttal threads, we build structured training instances through four stages: atomic weakness extraction and labeling, weakness–rebuttal alignment, rebuttal-guided feedback enhancement, and localized evidence retrieval.

实验结果

发现一(Table 2 自动指标):ActReview-RL 在 Task 1 上 ROUGE-L 28.24(较最佳基线 RbtAct-8B 的 23.89 提升 +4.35)、语义相似度 52.10、量规分 0.65,每实例仅生成 1.24 条断言,比动辄两条以上的零样本基线更接近参考的 1.37 条,说明 RL 抑制了过度生成;Task 2 全面领先训练模型:ROUGE-L 37.54(+7.27 vs Qwen3-32B)、BLEU 36.78、证据特异性 3.39(+1.82 vs RbtAct 的 1.57)、量规分 0.78。发现二(Table 3 成对评估):GPT-5.4 判定对 DeepReviewer-14B 的 T1 技术准确性胜率 75.5(人类 76.2),对 OpenReviewer-8B 的 T2 可操作性胜率 80.1(人类 74.5),对专用模型全面占优;对 GPT-5.1/Gemini 及 schema 变体接近 50-60 的平局区间;200 实例人类评估与 LLM 判定 93% 一致。发现三(Table 4/5/6 消融):rebuttal 增强数据使 T2 ROUGE-L 从 23.90 增至 35.50、BLEU 从 6.21 增至 34.10;候选感知量规的 T2 Overall 73.4 超过直接 judge 奖励 68.7 与固定量规 61.0;双任务 SFT 优于端到端(3.18 vs 2.76)。发现四(泛化与可靠性):175 个 2025-2026 留出实例上保持优势,严重技术错误率 6.29% 全场最低;360 个非支撑弱点-论文对上正确弃答 78.3%,支撑实例回答率 95.4%。

Human validation of alignment and filtering quality. Alignment is evaluated against adjudicated gold spans with token-level IoU ≥ 0.5 and filtering is evaluated against adjudicated keep/filter decisions. κ reports inter-annotator agreement.
Table 1: Human validation of alignment and filtering quality. Alignment is evaluated against adjudicated gold spans with token-level IoU ≥ 0.5 and filtering is evaluated against adjudicated keep/filter decisions. κ reports inter-annotator agreement.
Main results on ActReview-Bench for Task 1 and Task 2. LLM-based evaluation is conducted on 1,000 samples, while human evaluation is conducted on a 200-sample subset for annotation cost reasons.
Table 2: Main results on ActReview-Bench for Task 1 and Task 2. LLM-based evaluation is conducted on 1,000 samples, while human evaluation is conducted on a 200-sample subset for annotation cost reasons.
Pairwise LLM-as-a-Judge and human evaluation. Values report the adjusted win rate of ActReview-RL against each baseline, where ties count as half a win. LLM columns use GPT-5.4 on 1,000 instances, while Hum. columns use human annotations on a 200-instance subset.
Table 3: Pairwise LLM-as-a-Judge and human evaluation. Values report the adjusted win rate of ActReview-RL against each baseline, where ties count as half a win. LLM columns use GPT-5.4 on 1,000 instances, while Hum. columns use human annotations on a 200-instance subset.
Ablation studies on data construction and training context. Data compares raw-review and rebuttal-enhanced training. Context compares retrieved-chunk and full-paper training; both are evaluated with full-paper input.
Table 4: Ablation studies on data construction and training context. Data compares raw-review and rebuttal-enhanced training. Context compares retrieved-chunk and full-paper training; both are evaluated with full-paper input.
Reward design ablation. We compare SFT only with GRPO variants using increasingly structured reward signals: direct LLM-judge reward without rubrics, a fixed task-level rubric shared across instances, and our candidate-aware rubric. Scores are GPT-5.4 judge scores on ActReview-Bench.
Table 5: Reward design ablation. We compare SFT only with GRPO variants using increasingly structured reward signals: direct LLM-judge reward without rubrics, a fixed task-level rubric shared across instances, and our candidate-aware rubric. Scores are GPT-5.4 judge scores on ActReview-Bench.
Task-formulation ablation comparing end-to-end and two-task SFT under the same backbone, training instances, and evaluation protocol. Scores are GPT-5.4 rubric ratings on a 0–5 scale over 200 ActReview-Bench instances.
Table 6: Task-formulation ablation comparing end-to-end and two-task SFT under the same backbone, training instances, and evaluation protocol. Scores are GPT-5.4 rubric ratings on a 0–5 scale over 200 ActReview-Bench instances.
查看结构化数据
任务指标本文基线提升
Task 1:诊断断言生成 ROUGE-L 28.24(ActReview-RL) 23.89(RbtAct-8B,最佳基线) +4.35
Task 1:特异性(Specificity) Spec. 0.57(SFT 版为 0.96) 0.36(RbtAct-8B) +0.18(RL 相对最佳基线)
Task 1:量规评分 Rubric(0-1) 0.65 0.44(RbtAct-8B) +0.13(较最佳基线 +0.21→0.65,超 GPT-5.1 的 0.52)
Task 2:修改建议生成 ROUGE-L 37.54(ActReview-RL) 30.27(Qwen3-32B,最佳基线) +7.27
Task 2:证据特异性 Evid. spec. 3.39 1.57(RbtAct-8B;DeepReviewer/OpenReviewer 为 0.00) +1.82
Task 2:量规评分 Rubric(0-1) 0.78 0.61(GPT-5.1;最佳开源 RbtAct 0.57) +0.19(相对最佳基线)
Task 1 成对比较:技术准确性 调整胜率(vs DeepReviewer-14B) LLM 75.5 / 人类 76.2 50 为平局 +25.5(LLM judge)
Task 2 成对比较:可操作性 调整胜率(vs OpenReviewer-8B) LLM 80.1 / 人类 74.5 50 为平局 +30.1(LLM judge)
零样本弃答(负样本拒识) 弃答准确率(360 个非支撑对) 78.3%(支撑实例回答率 95.4%) 显著低于本文的最强基线 大幅领先(附录 G)

局限与改进

作者承认三点局限。第一,ActReview-Bench 只覆盖「rebuttal 可解决」的弱点,排除了根本性创新争议、深层概念分歧或不可修复的方法论缺陷——这些需要更广泛的文献比较甚至交互式研究指导,基准无法评测。第二,可操作性增益不等于技术准确性优势:对 GPT-5.1 schema 的 T1 技术准确性胜率仅 55.7,前沿专有 LLM 在该维度最具竞争力,本文优势集中在修改导向维度而非深层技术判断。第三,GPT-5.4 同时用于数据增强、量规构建、语义奖励打分与规模化评测,存在 judge 耦合风险,仅靠离线量规、实例不相交、200 实例人类评估缓解。我自己的观察:8B 底座限定上限,RL 后 Task 1 特异性反而从 SFT 的 0.96 降到 0.57(断言数从 1.74 降到 1.24),有欠覆盖有效弱点的风险;基准全部来自 ICLR/NeurIPS/EMNLP 的 CS 领域,跨学科泛化未知;rebuttal 只是「一条可行修改路径」而非唯一最优答案,可能系统性偏向作者式保守方案;弱点条件化推理意味着全文审计需逐标签跑一遍,推理成本随标签数线性增长。

独立分析的弱点

独立分析出四个弱点。其一,技术准确性天花板:所有增益来自数据与奖励设计,底座仍是 Qwen3-8B-Base,对 DeepReviewer-14B 的 T1 技术准确性胜率虽达 75.5,但对 GPT-5.1 schema 仅 55.7,整体技术错误率 28.00% 依然不低;改进方向是换更强底座复跑同一流程,或对建议输出追加事实核查与引用校验模块。其二,RL 压低了断言召回:Task 1 断言数 1.24 低于参考均值 1.37、特异性从 0.96 掉到 0.57,模型学会保守弃答,可能牺牲对真实弱点的覆盖;改进方向是把覆盖率作为硬约束加入量规,或加入漏检参考断言的惩罚项。其三,judge 耦合贯穿全流水线:GPT-5.4 既造数据又当奖励又当裁判,量规可能内嵌其偏好;改进方向是用异构模型家族交叉构建量规与评测,并做敏感性分析。其四,部署形态不友好:弱点条件化推理需对每个弱点标签独立查询,全文审计要跑几十次模型;改进方向是训练标签选择器先预测适用弱点子集,或蒸馏单次全文输入、多弱点输出的变体。

未来方向

作者在结论与局限中提出的方向:用更多样化的独立评审模型与更大规模专家评估验证可操作评审生成;提升深层技术判断能力,使模型在准确性维度也追平前沿 LLM;把框架扩展到 rebuttal 无法解决的关注类型(根本创新争议、不可修复缺陷)与交互式研究指导。基于本文成果可自然延伸的方向包括:第一,把 ActReview 接入提交前写作闭环,形成「诊断→修改→复查」的 agentic 循环,用第二轮诊断验证第一轮建议是否真正消除了弱点;第二,利用多轮 rebuttal 讨论(审稿人追问后的二次回应)构建更强监督,学习「不完整 rebuttal 情形下延伸或拒绝原始解决方案」的能力——论文附录 F.6 已显示 RL 模型在 50 个硬案例上 66% 的情况下会扩展或拒绝原始方案,说明有此潜力;第三,把 rebuttal 监督信号反哺评审员质量评估(哪些意见最终被有效回应)与会议审稿校准;第四,结合语义检索引入相关论文库,使「缺少与 X 的对比」类建议能具体到文献级别;第五,扩展到 CS 之外学科与中文评审场景。

复现评估

复现条件评估:论文给出了 ActReview-40K 数据集与代码的开源链接,ActReview-Bench 的 1000 个评测实例随数据发布,底座 Qwen3-8B-Base 公开可得,基线 DeepReviewer-14B、OpenReviewer-8B、RbtAct-8B、Qwen3-32B 均有 released checkpoints,推理评测部分复现难度低。主要门槛有三:其一,算力——8B 全参数 SFT 约 3.6 万条实例,再加 GRPO(每 prompt 采样 $K=8$),需要多卡 A100/H100 级资源,实验室可行但个人有压力;其二,API 成本——数据增强、量规合成与语义奖励打分依赖闭源的 GPT-5.4,4 万级样本构建与 RL 在线打分的调用费用可观;其三,人工标注——对齐验证、1000 实例基准构建采用双人独立标注加第三人仲裁,500 条增强审计与 200 条人类评估也需领域标注者。总体判断:用公开数据复现训练与评测为中等难度,从零复刻含人工标注的数据构建为高难度;弱点分类体系与量规模板等细节在附录 C/D 披露,有利于对齐。