← 返回 2026-08-14

修辞如何劫持AI审稿:AI同行评审中的修辞敏感性剖析 How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review

Ming Li, Chenguang Wang, Xirui Li, Xinyue Zeng, Dianqi Li, Peng Shi, Dawei Zhou, Tianyi Zhou 📅 2026-08-10 👍 48 2026-08-19 18:30
AI同行评审 LLM-as-a-Judge 修辞敏感性 可控改写实验 奖励劫持

保持科学内容不变仅改修辞,就能让AI审稿分数大幅波动,且效应高度依赖维度与模型配置。

前置知识

LLM-as-a-Judge(AI 评审)

用大语言模型代替人类对输出内容进行打分与反馈的范式。本文中五个模型(Gemini 3.5 Flash-Lite、Qwen 3.5 Flash、GPT-5 mini、GPT-5.5、Claude Sonnet 5)通过 OpenRouter 以 PDF 全文为输入,按 ICLR 量表输出结构化评审与数值评分。理解本文需要它,因为全文研究的“被攻击对象”正是这些 AI 评审,所有效应都以它们给出的分数变化来度量。

本文的全部实验设计(改写、盲评、配对比较)都建立在 AI 评审这一范式之上,不了解它就无法理解分数变化的含义与后果。

Reward Hacking(奖励劫持)

指智能体通过优化评测指标的表面信号而非真正提升任务质量来获取高分的失效模式。本文关注其“修辞版本”:在不改变方法、实验设置与报告数值的前提下,仅调整写作的立场、框架与措辞就能改变 AI 评审的分数,使分数不再忠实反映科学价值。

论文标题与核心问题就是“修辞如何 reward-hack AI 审稿人”,理解动机、伦理讨论与“这不是普适后门”的结论都必须先掌握这个概念。

ICLR 评审量表与 OA

ICLR 官方评审要求对 soundness(可靠性)、presentation(表达)、contribution(贡献)打子分,并给出 1–10 分的总评 Overall Assessment(OA)。本文以 OA 为主要结局指标,另定义 weak-accept 概率为评分 $\ge 6$ 的比例(6 也高于 ICLR 2026 录用论文的人类均分 5.39)。

文中所有数字结论(如 +0.93、−0.73、−1.36 分)都是 OA 或 weak-accept 概率的变化,不熟悉量表就无法判断这些变化在实际审稿中意味着什么。

配对/受控实验设计(paired analysis)

同一篇论文的“原文 vs 改写版”在相同评审模型、相同提示下分别评分,差值 $\Delta\text{OA}$ 即为干预效应,从而消除论文间质量差异的干扰;正负两个方向的变体共享同一原文,其差值衡量方向性分离。本文 42,396 条有效评审记录全部按论文×评审×提示配对分析,并用 5,000 次论文层 bootstrap 给出置信区间。

这是全文结论可信的方法论基础:没有配对设计,就无法把修辞效应与论文本身质量、评审模型差异区分开。

学术修辞与元话语(hedging/stance)

语言学中指作者校准确定性、立场与强调范围的手法,例如模糊限制语(hedging)、断言强度、证据强调与贡献定位。计算研究表明语言确定性与“感知到的科学严谨性”相关。本文把这类手法操作化为 6 个可双向改写的维度(新颖性立场、范围框架、证据框架、贡献显著度、技术语域、词汇句法复杂度)。

理解干预空间(Table 2)为何这样设计、为何“更谨慎的写作被扣分”构成问题,需要修辞学这一背景。

研究动机

已有研究反复发现 AI 审稿可被“与科学证据无关的改动”操纵:隐藏 prompt 注入可抬高评分或抑制批评;摘要级的同义改写攻击(Kaneko 2026)与重复“改写+过度声称”优化(Li et al. 2026b)能显著提分;整篇“论文洗稿”(Baumann et al. 2026)和对抗式重新包装(Yang et al. 2026b)也展示了提分可行性。但这些工作大多只回答“能不能把分刷高”,要么依赖隐蔽指令、要么依赖人工扰动、要么只在摘要层面操作,保留的只是提分最多的候选,因此无法回答更根本的问题:哪些修辞维度真正驱动评分变化?效应方向在不同评审模型之间是否稳定?是惩罚谨慎写作还是奖励夸张写作?此外,自然语料中更强的论文往往写作也更自信、更 polished,跨论文比较无法把表达与质量分开。简言之,在本文之前学界缺乏一张“维度×方向×改写器×评审×协议”的系统性修辞敏感性地图,无法判断这是否构成一个普适的 reward hack。

本文的目标是本文的具体目标是构建一个端到端的受控分析框架,在完整论文粒度上把“修辞呈现”与“科学内容”分离,并系统回答:当报告的方法、实验设置与数值结果保持不变时,哪些修辞选择会改变 AI 评审的总评(OA)与弱接收概率?这些效应在 6 个修辞维度、正负两个方向、2 个改写代理、5 个评审模型、标准与严格两种评审协议下如何变化?效应如何随人类评分层级与 AI 初始分数移动?在此基础上,进一步检验更复杂的改写流水线——六维联合改写、三轮递归改写、评审者引导的二次改写——是否能带来更大、更稳定的收益。最终目的是为 AI 辅助评审的“修辞鲁棒性”评估提供证据与评测思路,而非交付一个可用的攻击工具。

与已有工作不同的是,本文的独特切入角度有三点。其一,双向干预设计:每个修辞维度都从同一个匿名化基线独立地向“正”“负”两个方向改写,正负变体的对比把“方向性敏感”与“改写行为本身导致的分数漂移”干净地分开,这在此前的攻击导向工作中不存在。其二,完整 LaTeX 工程级的代理式改写:不是摘要或句子级替换,而是让改写代理重写正文叙事、图表标题、表格与结果解读,仅用引用键、标签、图形路径、数学/代码环境等结构锚点做程序化保持检查,比以往任何工作都更接近真实的内容保持型“洗稿”。其三,保留全部改写结果(包括降分的),并按人类评分分层、按 AI 评审初始分分层做配对分析,从而把 rewriter、reviewer、protocol 三个因素的贡献分解开,得出“rewriter 决定分离度、reviewer 决定大小与符号、protocol 平移刻度”的归因结论。

核心方法

直觉上,只要把同一篇论文做成若干“内容不变、口吻不同”的版本,让多个互不知情的 AI 评审盲评,再做论文内配对比较,就能测出评审对哪些修辞信号敏感、敏感多少。技术路线分三阶段。第一阶段构建可信基线:从 ICLR 2026 投稿中按人类总评分六个区间($[1,3),[3,4),[4,5),[5,6),[6,7),[7,8.5]$)各抽 20 篇共 120 篇,用 token 余弦相似度与 5-gram Jaccard 匹配公开 arXiv LaTeX 源,再用代理式匿名化删去作者、单位、致谢等身份信息并人工核验。第二阶段受控改写:GPT-5.5(经 Codex CLI)与 Opus 4.8(经 Claude Code)两个改写代理对每篇生成 6 维×2 方向共 12 个变体(2,880 篇),外加六维联合改写 240 篇、三轮递归改写 480 篇、评审者引导改写 480 篇,连同 120 篇原文构成 4,200 篇语料。第三阶段盲评与配对分析:5 个评审模型在标准/严格两种提示下输出结构化评审,共 42,396 条有效记录,全部按论文内配对计算 $\Delta$OA、weak-accept 概率变化与正负对比。

核心创新是把“修辞敏感性”当作一个可分解的实验对象,而不是像以往工作那样只报告单一攻击的成功率。与 Kaneko (2026)、Li et al. (2026b)、Baumann et al. (2026) 等只搜索“能提分的改写”不同,本文预先从各大会议审稿指南中指定 6 个修辞维度(新颖性立场、范围框架、证据框架、贡献显著度、技术语域、词汇句法复杂度),每个维度双向改写、无条件保留全部结果,因而能估计每个维度的正负对比(positive−negative contrast)并在模型与协议间检验其稳定性。另一个关键想法是三维归因分解:改写器(rewriter)主要决定正负变体之间的分离度,评审模型(reviewer)决定分数效应的大小甚至符号,评审协议(protocol)主要平移分数刻度而不改变敏感性。此外,“AI 初始分决定移动方向”(低分升、高分降)的发现把大量表面积效应归因于量表边界与均值回归,纠正了对修辞效应的过度解读。

方法步骤详情

步骤一(种子语料):经 OpenReview API 获取 ICLR 2026 投稿,按人类 OA 六区间各抽 20 篇得 120 篇,用 token 余弦相似度与 5-gram Jaccard 匹配 arXiv LaTeX 源。步骤二(匿名化):代理式 LLM 删除作者、单位、致谢与身份链接,源差异检查限定编辑区域并人工核验。步骤三(改写):每个改写模型对每篇生成 6 维×2 方向 12 个变体,共 2,880 篇;每轮改写=维度指令+项目级保持约束(保留方法、设置、报告数值与证据边界,不要求句级语义等价),程序化检查引用键、标签、图形路径、数学/算法环境与参考文献,违例回炉修复,无法修复或编译失败即丢弃。增强流程:六维正向联合改写 240 篇;同提示三轮递归改写 480 篇;评审者引导=联合初稿→骨干模型标准自评审→按结构化意见二次改写(480 篇)。步骤四(评审):PDF 经 OpenRouter 交 5 个评审模型,标准/严格两协议(严格提示要求高分须有具体证据、不得奖励不改变科学评估的表达),输出 OA 与二级分数。步骤五(分析):配对计算 $\Delta$OA 与弱接收概率变化、正负对比、按人类/AI 分数分层,5,000 次论文层 bootstrap 区间,缺失不插补。

技术新颖性

技术新颖性体现在四个层面。第一,这是首个在整篇论文粒度、双向、多维度上系统刻画 AI 审稿修辞敏感性的受控研究:此前工作要么只做摘要级改写攻击,要么用字符/词级人工扰动,要么整篇洗稿但只报告提分结果,均无法给出“哪个维度、哪个方向、对哪个评审有效”的结构化结论。第二,完整 LaTeX 工程的代理式改写 harness 本身是工程贡献:不要求句级语义等价,而是“结构锚点程序化检查+软性内容保持约束+编译-修复循环”,允许改写 captions、表格与结果解读,最大化呈现变化空间同时保住科学内容。第三,把 42,396 条评审组织成“维度×方向×rewriter×reviewer×protocol”面板,通过固定模型配对与双重分层(人类评分段、AI 初始分段)识别出低分上升/高分下降的均值回归模式,并区分“评审间对论文排序一致($\rho$ 较高)但对改写效应不一致(跨协议 $\rho$ 仅 .081)”这一微妙现象。第四,对联合/递归/评审者引导三种更复杂流水线给出配置依赖、收益递减的否定性结论,这类负结果在攻击导向文献中罕见,但对防御设计更有价值。

Overview of the rewrite and review pipeline. Anonymized manuscripts are rewritten through single-dimension or enhanced workflows and evaluated by five AI reviewers under standard and strict protocols.
Figure 1: Overview of the rewrite and review pipeline. Anonymized manuscripts are rewritten through single-dimension or enhanced workflows and evaluated by five AI reviewers under standard and strict protocols.

实验结果

发现一:修辞敏感性是结构化的。证据框架与新颖性立场产生最大正负对比,范围框架是较弱第二梯队,其余维度小且不稳定(Table 3 全均值:证据 +0.289/−0.303,新颖性 +0.187/−0.353,范围 +0.136/−0.289,贡献 +0.192/+0.049,技术 +0.142/+0.034,词法仅 +0.017/+0.006)。最强单格在 Opus 4.8 改写×Gemini 3.5 FL 严格评审:证据正向 +0.93,新颖性负向 −0.73。决策层面证据框架的正负弱接收概率对比 13.0 个百分点、新颖性 12.0、范围 9.0;新颖性与范围主要靠惩罚负向起效,证据框架双向都能大幅移分。层级在人类评分各段稳定(120 篇中超 100 篇呈预期排序),但移动方向强烈依赖 AI 初始分:正向证据变体在初始分 [1,3] 段平均 +1.05,[8,10] 段为 −0.19。发现二:复杂流水线收益配置依赖且递减。联合改写仅 Opus 4.8 对所有评审正收益:reviewer 均值 +0.289(标准)/+0.463(严格),GPT-5.5 仅 +0.021/+0.045;相对六个单维正向均值,Opus 联合 +0.160 而 GPT-5.5 −0.074,组合未必优于单维。递归改写第二轮把 Opus 从 +0.289 提到 +0.410(标准)/+0.463 到 +0.624(严格),第三轮几乎无增益;评审者引导(Opus +0.396/+0.557)四个“引导减无引导二改”对比全为负。发现三:rewriter 决定正负分离度(Opus 更宽),reviewer 决定大小与符号(Sonnet 5 全面下移约 −0.36,Qwen 3.5 F 与 GPT-5 mini 分布最宽);严格协议把绝对 OA 从 6.296 压到 4.934(−1.361,95.0% 论文降分)但排序 $\rho=.862$ 不变,改写效应跨协议相关仅 .081——严格提示不降低修辞敏感性。$\Delta$OA 与 contribution/soundness 的相关强于 presentation(Qwen 标准下 $\rho=.747$),同一修辞变化被不同评审映射到不同子分数。附录对照:标准提示下 AI 评分比人类 OA 高 0.418–2.934 分,MAE 1.029–2.934,Spearman $\rho$ 仅 0.395–0.621。

Overview of the experimental framework and scale. The table summarizes the scope of the study.
Table 1: Overview of the experimental framework and scale. The table summarizes the scope of the study.
Definition of the rhetorical intervention space. Each dimension is rewritten in opposing directions while preserving scientific content.
Table 2: Definition of the rhetorical intervention space. Each dimension is rewritten in opposing directions while preserving scientific content.
Overview of rhetorical presentation effects in AI review. Evidence framing and novelty stance produce the largest changes in overall assessment.
Table 3: Overview of rhetorical presentation effects in AI review. Evidence framing and novelty stance produce the largest changes in overall assessment.
Rhetorical effects across human OA ranges under standard evaluation.
Table 4: Rhetorical effects across human OA ranges under standard evaluation.
Rhetorical effects across original AI-review score ranges under standard evaluation.
Table 5: Rhetorical effects across original AI-review score ranges under standard evaluation.
Effects of joint and reviewer-guided rewriting. ΔOA and Δ≥6 report changes from the prompt-matched original in mean OA and weak-accept probability, respectively.
Table 6: Effects of joint and reviewer-guided rewriting. ΔOA and Δ≥6 report changes from the prompt-matched original in mean OA and weak-accept probability, respectively.
Joint rewrite effects across AI-original and human OA ranges.
Table 7: Joint rewrite effects across AI-original and human OA ranges.
Effects of review protocol on absolute scores and rewrite sensitivity.
Table 8: Effects of review protocol on absolute scores and rewrite sensitivity.
Changes in secondary review scores and their association with OA.
Table 9: Changes in secondary review scores and their association with OA.
AI versus human overall assessments on the anonymized original papers.
Table 11: AI versus human overall assessments on the anonymized original papers.
Overview of rhetorical effects on AI scientific review. Evidence framing and novelty stance produce the largest positive-negative contrasts in overall assessment.
Figure 2: Overview of rhetorical effects on AI scientific review. Evidence framing and novelty stance produce the largest positive-negative contrasts in overall assessment.
Reviewer-specific OA trajectories under recursive joint rewriting. Each round jointly applies all six positive-direction interventions to the manuscript produced in the preceding round.
Figure 3: Reviewer-specific OA trajectories under recursive joint rewriting. Each round jointly applies all six positive-direction interventions to the manuscript produced in the preceding round.
Reviewer and rewriter heterogeneity in effects. Paper-level ΔOA distributions are shown across rhetorical dimensions and directions.
Figure 4: Reviewer and rewriter heterogeneity in effects. Paper-level ΔOA distributions are shown across rhetorical dimensions and directions.
Fixed-model heterogeneity in the directional response to rhetorical rewriting. Each cell reports the mean overall-rating difference between the positive and negative conditions for one pairing of a rewrite model and a reviewer model.
Figure 5: Fixed-model heterogeneity in the directional response to rhetorical rewriting. Each cell reports the mean overall-rating difference between the positive and negative conditions for one pairing of a rewrite model and a reviewer model.
查看结构化数据
任务指标本文基线提升
正向证据框架改写对总评分的影响 配对 ΔOA(相对同提示原文的均值变化) +0.289(全均值),最强单格 +0.93(Opus 4.8 重写 × Gemini 3.5 FL 严格评审) 词汇/句法复杂度正向改写 +0.017(全均值) 效应约为最弱维度的 17 倍,是全部六维中最大的正向杠杆
负向新颖性立场改写(更谨慎的声称) 配对 ΔOA −0.353(全均值),最强单格 −0.73(Opus 4.8 × Gemini 3.5 FL 严格评审) 词汇复杂度负向改写 +0.006(几乎为零) 惩罚最强的维度,表明 AI 评审会系统性地扣分恰当地谨慎写作
弱接收概率(评分≥6 比例)的正负对比 百分点(pp) 证据框架 13.0 pp、新颖性立场 12.0 pp、范围框架 9.0 pp 词汇/句法复杂度维度接近 0 pp 决策级效应几乎完全被前三个维度垄断
六维联合正向改写 reviewer 均值 ΔOA(标准/严格) Opus 4.8:+0.289 / +0.463(所有评审均为正) GPT-5.5:+0.021 / +0.045(近零) 揭示强烈的重写器依赖性,联合改写不是模型无关的提分路线
严格评审提示对绝对分数与敏感性的影响 平均 OA 与跨协议相关性 OA 6.296→4.934(−1.361),95.0% 论文降分;改写效应跨协议 Spearman ρ=.081 标准提示平均 OA 6.296 排序保持(ρ=.862)但严格化不能降低修辞敏感性,防御无效的负面证据

局限与改进

作者承认四点局限:语料仅限 ICLR 2026 有可恢复 LaTeX 源且公开评审的投稿,未必推广到其他会议与学科;全文改写+多模型评审昂贵(API 成本 $29,165.89),42,480 次计划评审中 84 条缺失且非随机——Sonnet 5 因疑似安全护栏对一篇越狱主题论文的 26 个评审格反复失败,主题相关缺失可能引入偏差;六个维度非正交,全篇干预效应不能解释为单一语言特征的独立系数;绝大多数配置每稿仅一次评审,重复采样只在辅助审计中考察,结论刻画被测模型与提示而非人类评审。我的补充观察:所有结论是描述性关联而非因果中介,修辞改变分数的机制未被识别;评审经 OpenRouter 单次调用且采样参数用提供商默认值,评审噪声与真实敏感性未做方差分解,跨协议改写效应相关仅 .081 可能部分是采样噪声;分层表中部分格子不足 5 篇(带†),AI 初始分 [8,10] 段的估计脆弱;内容保持依赖提示软约束加结构锚点检查,无法排除改写代理在结果解读与强调取舍中引入实质倾向。

独立分析的弱点

弱点一:敏感性地图是 2026 年 5 个模型的快照,模型迭代后效应结构可能漂移,论文未提供持续监测方案——可把框架压缩为轻量“金丝雀基准”(30 篇×6 维×2 向×3 评审)定期探测新模型。弱点二:只研究 AI 评审,未测现实中更常见的“AI 改写+人类评审”组合——应招募人类审稿人对改写稿盲评,估计效应向人类的迁移。弱点三:单次评审噪声大,严格协议下改写效应相关仅 .081 可能与采样方差混淆——应做每稿 $k$ 次评审的方差分解,把评审间方差从真实敏感性中分离。弱点四:防御侧空白,论文诊断漏洞但未给缓解方案——可探索评审前修辞规范化预处理、要求评审先抽取可验证声明再逐条核对、训练对内容保持型变体不变的评审模型、构建原文-改写配对检测器。弱点五:六维度由作者依审稿指南预设,可能遗漏相关工作贬低、引用策略、图表设计等重要修辞轴——可用无监督差异挖掘从大规模真实改写中自动发现新维度。

未来方向

作者提出的方向:AI 评审系统的评估应跨多个评审模型与协议检验修辞鲁棒性,而不能只看与人类评分的平均一致度或总体评分行为;需要设计对内容保持型变体鲁棒的评审流程。基于本文成果可延伸的研究包括:(1) 机制解释——用可解释性方法定位评审模型中对断言强度、证据密度、贡献措辞敏感的内部表征,回答“为什么证据框架最强”;(2) 防御对比实验——在同一框架内系统比较严格提示、多评审辩论、声明抽取核对、修辞规范化重写等缓解手段的有效性,本文已证明严格提示无效,这正是防御研究的起点;(3) 跨领域泛化——把框架扩展到 NeurIPS/ACL/医学期刊及其他语言的稿件,检验层级结构是否稳定;(4) 检测任务——训练分类器识别“面向 AI 审稿人优化”的文本,并研究其与人类感知写作质量的关系;(5) 博弈建模——把作者代理、改写代理与评审代理放入重复博弈,分析修辞军备竞赛是否会收敛以及均衡下的评审信息含量;(6) 与 reward hacking 理论建立联系,构造“呈现-实质”可分离的评审目标函数,为更安全的 LLM 评测设计提供原则。

复现评估

复现条件透明但成本高昂。开源:代码与项目页已公开(GitHub: MingLiiii/Dissecting_AI_Reviews),附录 G 提供全部改写提示,附录 B 给出评审执行细节(OpenRouter PDF 输入、提供商默认采样参数)与分阶段成本表,透明度在同类研究中属高水准。数据:需 ICLR 2026 OpenReview 数据及匹配的公开 arXiv LaTeX 源,随时间可获取性下降,但框架可迁移到任一届数据。费用:全 API 调用、无训练,直接成本 $29,165.89(改写 $20,583.34+评审 $8,582.55),单维改写阶段占 $19,627.77,且需 GPT-5.5/Codex CLI、Opus 4.8/Claude Code 及 5 个评审模型的付费访问。完整复现约需数万美元与大量工程(LaTeX 编译-检查-修复循环、匿名化人工核验);缩减版(20–30 篇×3 个关键维度×2 向×3 评审)数千美元即可验证“证据>新颖性>范围>其余”层级。风险:模型版本更替改变 API 行为、安全护栏造成评审缺失、OpenRouter 默认参数变动。