← 返回 2026-07-30

DecoEvo:解耦评分的求解器与评分量规生成器技能共进化 DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space

Jiangwang Chen, Zixin Song, Junlin Liu, Shuaiyu Zhou, Haiyan Wu, Haihan Shi, Chenxi Zhou, Hanqing Li, Xiao Yang, Da Zhu, Guanjun Jiang, Hai Wan, Xibin Zhao 📅 2026-07-28 👍 65 2026-08-04 18:30
LLM评判 协同进化 技能进化 文本空间优化 评分量规 黑盒适配

解耦评分目标,让求解器与评分量规在文本空间协同进化

前置知识

文本空间优化(Text-Space Optimization)

文本空间优化是一种适配大语言模型的方式:不去修改模型权重,而是编辑外部的自然语言制品(如提示词、技能文档、示例)。代表性工作包括 OPRO(搜索提示词)、DSPy(优化指令和示例)、TextGrad(用文本反馈指导修改)和 SkillOpt(把可复用的技能文档当作可训练状态)。它的优点是模型可作为黑盒,且优化后的状态是可检视、可解释的自然语言,而非不可读的权重。

DecoEvo 的整个框架建立在文本空间优化之上,理解它才能明白为什么作者坚持不更新权重、为什么所有优化角色都用同一个冻结骨干模型,以及为什么'评分量规'本身可以作为一个持久化的可训练技能。

基于评分量规的 LLM 评判(Rubric-Based LLM Judge)

在开放式任务(如医疗咨询、创意写作、研究辅助)上,答案的好坏是多维度的,单靠一个标量分数难以评估。评分量规把任务质量拆成若干自然语言维度,每个维度 $c_i$ 配一个分值 $w_i$,由一个固定的逐条评判器 $E$ 对每条返回 $e(q,r,c_i) \in [0,1]$,再按权重加权得到 $S(q,r,R_q)=\frac{\sum_i w_i e(q,r,c_i)}{\sum_i w_i}$。这样能给求解器提供准则级别的细粒度反馈。

本文的核心矛盾就是:量规决定求解器能看见哪些错误维度,而量规本身又不完整——这既构成了动机(量规遗漏的维度是盲区),也决定了方法(必须让量规自己进化)。

评分耦合的协同适应(Score-Coupled Co-Adaptation)

如果同时优化求解器和量规生成器,且生成器的更新被'当前求解器在生成量规下的总分上升'所奖励,就会出现危险:更新规则会偏向求解器已经满足的准则,而不是更反映任务质量的准则。于是代理分数 $J_D(s,g)$ 可以仅因为量规变'容易满足'而上升,与真实任务质量脱节。这种现象类比于经典的协同进化不稳定性和奖励过优化(reward overoptimization)。

这是本文要解决的核心问题,也是 SC-CoEvo 基线为何在 15 个设置里有 13 个输给 SkillOpt、在 7 个设置里甚至不如零样本的根本原因。理解它才能看懂为什么必须做'评分解耦'。

Pareto 式候选接受规则

生成器候选的接受不看一个标量总分,而是看多个独立的审计目标。设 $\Delta_k = \Phi_k(g') - \Phi_k(g_t)$,候选被接受当且仅当 $\exists k \in K_t: \Delta_k > \delta$ 且 $\forall j \in K_t: \Delta_j \geq -\eta$。也就是说至少有一个审计目标要有实质性提升(超过 $\delta$),同时任何一个审计目标都不能退化超过容忍度 $\eta$。这种规则避免了把异质的审计分数强行加权成一个标量。

这是'评分解耦'在工程上的落地方式:拒绝用 $J_D$ 当生成器目标,改用结构审计和对比审计两个独立信号的 Pareto 前沿,是理解方法新颖性的关键。

研究动机

文本空间优化在开放式任务(医疗咨询、创意写作、研究辅助)上面临一个根本矛盾。现有方法(SkillOpt、OPRO、DSPy、TextGrad)普遍把评估目标固定,而开放式任务的质量是多维的、多答案都可能有效。固定量规一旦不完整,求解器在被量规覆盖的准则上变好后,未被覆盖的维度(例如医疗量规强调事实准确和清晰但漏了禁忌症警告,会让其他方面很强但安全性不同的答案无法区分)就成了优化信号的盲区,求解器会过度专门化到被测量的准则上,量规也随之失去判别力。更糟的是,简单地让量规随求解器一起进化也不可靠:如果生成器更新被'当前求解器的总分上升'奖励(评分耦合),更新规则会偏向求解器已经满足的准则,代理分数可以脱离真实任务质量而虚高,这正是经典协同进化不稳定性和奖励过优化在文本空间的重现。

本文的目标是本文的目标是在冻结骨干模型、保持黑盒可检视的前提下,让求解器技能和评分量规生成器技能协同进化,同时彻底切断生成器更新与求解器总分之间的直接奖励关系。具体地,作者要:(1) 用准则级别反馈驱动求解器改进;(2) 用两个互补的、与总分独立的审计(结构审计找'量规漏了什么'、对比审计找'量规区分不出什么')来定位生成器的盲点;(3) 把审计诊断蒸馏成可复用的生成器技能修订;(4) 在五个基准、三个骨干模型的 15 种组合上验证解耦设计能稳定带来增益,并且能跨基准迁移。

与已有工作不同的是,与权重空间里同时训练策略和量规的近期工作(Rezaei 等的对比量规生成、OpenRS、DRTulu、对抗式 policy–rubric 共进化)不同,本文研究的是冻结黑盒设置:求解器和生成器都是持久的文本制品,生成器的每次修改都改变了求解器的训练代理,因此总分无法区分'求解器真的变好'和'量规变容易'这一识别问题。DecoEvo 的独特切入角度是显式地把生成器的提出与接受都与总分解耦,但保留逐响应分数用于定位近并列对和验证盲点修复,从而既避免了评分耦合的退化,又没有丢弃分数信号的全部用途。

核心方法

直觉上,DecoEvo 维护两份可编辑的自然语言技能:求解器技能 $s$ 存可复用的任务策略,生成器技能 $g$ 存构造针对具体问题的量规的原则。内层循环用准则级别反馈更新求解器,外层循环用两个冻结角色的审计更新生成器;关键约束是生成器的提出与接受都不允许使用 $J_D(s_t,g_t)$、$J_D(s_t,g')$ 或两者之差。所有优化角色(求解器、量规生成器、逐条评判器、两个审计器、技能重写器)都用同一个冻结骨干加不同角色的提示实现,角色分离只改变提示和更新目标。形式化上:求解器产生 $r_q(s)=\mathrm{Solve}(q;s)$,生成器产生量规 $R_q(g)=\{(c_i,w_i)\}_{i=1}^{m_q}$,固定评判器返回 $e(q,r,c_i)\in[0,1]$,训练代理 $J_D(s,g)=\frac{1}{|D|}\sum_{q\in D}S(q,r_q(s),R_q(g))$,其中 $S=\frac{\sum_i w_i e(q,r,c_i)}{\sum_i w_i}$;真实目标是基准官方评分器用留出金量规算出的效用 $U(s)$。

核心创新是 Definition 1 定义的'评分解耦的生成器更新':生成器候选的提出和接受可以使用问题、生成量规、逐响应分数、结构化审计记录,但绝不能使用 $J_D(s_t,g_t)$、$J_D(s_t,g')$ 或两者之差作为目标。这从根本上移除了'量规朝求解器漂移'的直接激励,同时保留逐响应分数用于定位近并列对和验证盲点修复。这与已有方法的本质区别在于:SkillOpt 完全冻结量规生成器;SC-CoEvo 让生成器更新被总分驱动(于是退化);权重空间方法依赖梯度更新参数。DecoEvo 则在文本空间里,用两个互补但目标独立的冻结审计器把生成器的进化引导到'覆盖遗漏维度'和'区分近似响应'两个正交方向上。

方法步骤详情

方法分内层(求解器进化)和外层(生成器进化)。内层第 $t$ 步:求解器用 $s_t$ 回答批量 $B_t\subset D_{tr}$,生成器为每题产生量规 $R_q(g_t)$,评判器对每条准则返回分数与失败原因,选中失败交给求解器重写器整合成候选 $s'$;仅当 $J_{V_s}(s',g_t) > J_{V_s}(s_t,g_t)+\varepsilon$ 时接受(同题配对、缓存每题量规以隔离噪声),否则递增停顿计数器作为外层触发。外层每 $K$ 步或连续 $M$ 次拒绝后运行'审计–蒸馏–验证':(1) 结构审计器接收 $\pi^{str}_\tau$、问题、生成量规(不看响应或分数),返回充分性 $u_q\in[0,1]$、理由 $\xi_q$、修复 $\kappa_q$;(2) 对比审计器对每题采 $L$ 个 rollout,按 $|z_i-z_j|\le\tau_{tie}$ 构造近并列对,先量规盲判给 $y^{ij}_q$,再看量规解释为何遗漏并提议 $\kappa^{ij}_q$,非等价对重排成 $(r^+,r^-)$ 构成 $\Gamma^{(t)}_{ctr}$,分辨率率 $\phi_{ctr}=\frac{1}{|Q_\Gamma|}\sum_q\frac{1}{|\Gamma_q|}\sum_p\mathbf{1}[m_g(p)\ge\gamma]$;(3) 重写器只看探针记录蒸馏成候选 $g'$,在留出集 $V_g$ 上配对验证,按 Pareto 规则 $\exists k: \Delta_k>\delta$ 且 $\forall j: \Delta_j\ge -\eta$ 接受。$V_s$、$V_g$ 仅用于选择,最终结果在从未查询的留出测试集上计算。

技术新颖性

新颖性体现在四点。第一,把文本空间的求解器–量规共进化形式化为一个评分耦合问题,并显式给出 Definition 1 这一可操作的'解耦'定义,这是首次在冻结黑盒文本空间设置下处理该识别问题。第二,用两个互补但目标独立的冻结审计器(结构审计查覆盖、对比审计查判别)把盲点转化为可复用的量规生成原则,不需要金量规监督也不需要权重更新。第三,对比审计的两阶段协议(先量规盲判再解释)专门减少对被审视量规的锚定,这是评估元方法上的一个细节创新。第四,Pareto 式接受规则拒绝把异质审计分数强加权成单标量,$\exists k: \Delta_k>\delta$ 且 $\forall j: \Delta_j\ge -\eta$ 既要求至少一项实质改善又禁止任何目标大幅退化,工程上很稳健。

Overview of DecoEvo.
Figure 2: Overview of DecoEvo.

实验结果

总体有效性(Table 1):DecoEvo 在 GPT-4o/Qwen3-4B/Qwen3-8B 三骨干的全部 15 个组合上领先。相对 SkillOpt 的平均增益为 5.0%(3.10 分,95% CI [2.88,3.32])、2.9%(1.74 分)、2.8%(1.78 分),经 Holm 校正均显著。以 GPT-4o 为例:HealthBench 45.3(vs 41.7,+8.6%)、LLMEval-Med 迁移 60.2(+4.5%)、WritingBench 66.1(+3.4%)、Creative Writing 迁移 82.7(+2.7%)、ResearchQA 69.7(+7.6%)。跨基准迁移无任何迁移基准上的更新,证明求解器技能编码的是可复用策略。反向对照:SC-CoEvo 在 15 个里 13 个低于 SkillOpt、7 个低于零样本,证明用总分选生成器会擦除求解器收益。消融(Table 2):移除对比审计损失 1.7–2.1、结构审计 1.3–1.7、验证 2.4–2.9(最大)、蒸馏 1.4–1.8。控制实验(Table 3/4):Task-Prior 仅 +0.4–0.7、Budget-Matched 仅 +0.4–0.6,Direct Audit 用 98.8% token 恢复 2.0/3.6 分,说明审计信号有用但'信号存放在哪'更关键。动力学(Figure 3):SC-CoEvo 官方金量规先升后降但内部代理仍达 89.1,印证评分耦合退化。对齐(Table 5):DecoEvo 准则级 F1 相对 SkillOpt 提升约 12 个百分点,SC-CoEvo 反降 5.3–6.3 分。

Main results under gold rubrics.
Table 1: Main results under gold rubrics.
Ablation study on HealthBench, averaged over five matched runs.
Table 2: Ablation study on HealthBench, averaged over five matched runs.
Controls on HealthBench, averaged over five matched runs.
Table 3: Controls on HealthBench, averaged over five matched runs.
Mean per-run optimization cost on HealthBench with GPT-4o.
Table 4: Mean per-run optimization cost on HealthBench with GPT-4o.
Criterion-level gold-rubric overlap for the GPT-4o backbone.
Table 5: Criterion-level gold-rubric overlap for the GPT-4o backbone.
Training dynamics on a held-out HealthBench diagnostic set.
Figure 3: Training dynamics on a held-out HealthBench diagnostic set.
查看结构化数据
任务指标本文基线提升
HealthBench(医疗咨询,官方金量规评分 0–100) 官方金量规分数 GPT-4o 45.3、Qwen3-4B 41.5、Qwen3-8B 45.2 SkillOpt: 41.7 / 39.9 / 43.0;SC-CoEvo: 40.3 / 38.9 / 41.5 相对 SkillOpt +8.6% / +4.0% / +5.1%
LLMEval-Med(从 HealthBench 跨基准迁移) 官方金量规分数 GPT-4o 60.2、Qwen3-4B 65.1、Qwen3-8B 66.9 SkillOpt: 57.6 / 64.2 / 65.6 相对 SkillOpt +4.5% / +1.4% / +2.0%
WritingBench(创意写作) 官方金量规分数 GPT-4o 66.1、Qwen3-4B 62.9、Qwen3-8B 63.5 SkillOpt: 63.9 / 61.1 / 61.8 相对 SkillOpt +3.4% / +2.9% / +2.8%
EQ-Bench Creative Writing v3(从 WritingBench 跨基准迁移) 官方金量规分数 GPT-4o 82.7、Qwen3-4B 73.8、Qwen3-8B 77.7 SkillOpt: 80.5 / 71.0 / 75.2 相对 SkillOpt +2.7% / +3.9% / +3.3%
ResearchQA(研究问答) 官方金量规分数 GPT-4o 69.7、Qwen3-4B 67.4、Qwen3-8B 71.6 SkillOpt: 64.8 / 65.8 / 70.4 相对 SkillOpt +7.6% / +2.4% / +1.7%
准则级金量规对齐 F1(HealthBench/WritingBench/ResearchQA,GPT-4o) 宏平均 F1(%) 56.9 / 60.3 / 58.7 SkillOpt: 44.6 / 48.1 / 46.4;SC-CoEvo: 38.3 / 42.8 / 40.8 相对 SkillOpt 约 +12 个百分点

局限与改进

作者明确承认两点局限:第一,所有证据都局限于'优化角色共享同一个骨干模型'的设置,没有测试求解器、生成器、审计器用不同骨干的情形,这种角色异质性可能影响解耦的效果;第二,跨基准迁移只在医学和写作两个域内进行,没有验证跨域(例如从医学到编程)迁移是否仍稳健,也没有更广泛的人工评估。我个人观察到的额外局限:(1) 所有审计器、重写器、评判器都是同一个冻结骨干的不同提示,意味着审计器的'量规盲判'和'结构审计'本身受限于该骨干的判别能力,若骨干本身在开放式任务上判别力不足,审计的诊断质量会成为新的天花板;(2) Pareto 接受规则需要两个留出验证集 $V_s$ 和 $V_g$ 反复做接受/拒绝,它们本质是模型选择集而非无偏评估集,标注和算力成本被低估;(3) 对比审计靠随机 rollout 产生近并列对,对求解器已经很确定的任务(rollout 方差极小)可能产生很少近并列对,使 $\Gamma_{ctr}$ 为空、外层退化为只剩结构审计;(4) 增益绝对值(1.74–3.10 分)虽显著但仍偏小,是否值得 1.89× 的 token 成本取决于下游应用。

独立分析的弱点

第一个弱点是审计器的判别质量受限于共享骨干。当骨干在医疗安全、写作风格等维度判别力不足时,结构审计的 $u_q$ 和对比审计的盲标签 $y^{ij}_q$ 都会带噪,蒸馏出的生成器原则会失真。改进方向:允许审计器用更强的独立骨干(作者也在未来工作中提到),或引入少量人工标注的高质量盲标签做校准。第二个弱点是近并列对的供给依赖 rollout 方差。对求解器高度收敛的任务,$N^{(t)}_q$ 可能稀疏甚至为空,外层对比审计失效。改进方向:用主动扰动(温度调度、对抗扰动 prompt)故意制造分叉 rollout。第三个弱点是 Pareto 规则的超参 $\delta$、$\eta$ 和审计调度 $K$、停顿阈值 $M$ 依赖一次性 pilot 搜索,论文未给敏感性曲线,工程上难调。改进方向:用贝叶斯优化或自适应阈值。第四个弱点是 $V_s$、$V_g$ 被反复查询会过拟,作者虽声明不报告为最终性能,但未给过拟风险的定量分析。改进方向:交叉验证或在线留出。第五个弱点是五基准全偏向医学/写作/研究问答这类有较结构化量规的任务,对真正开放式任务(故事生成、辩论)的泛化未被验证。

未来方向

作者明确提出的方向:(1) 测试不同骨干跨角色的设置(求解器、生成器、审计器分别用不同模型);(2) 跨域迁移而不仅是医学/写作域内迁移;(3) 更广泛的人工评估。基于成果可延伸的方向:(1) 把 DecoEvo 的'评分解耦'原则推广到权重空间训练,作为对奖励过优化的正则手段——即训练时用与策略奖励解耦的独立审计信号更新奖励模型;(2) 把双审计框架推广到更多审计维度(如安全性、公平性、事实性审计器),形成多维 Pareto;(3) 探索把蒸馏出的生成器技能作为可迁移资产,在不同任务间共享(论文只迁移了求解器技能);(4) 研究生成器技能的'天花板'——当两个审计都饱和后是否还有未覆盖的盲点,需要新的审计类型;(5) 把近并列对比审计的思想用于主动学习,自动构造模型最不确定的样本对来标注。

复现评估

复现评估中等偏上。有利因素:作者报告了五次匹配种子的均值±样本标准差,给出主比较的配对 95% 置信区间和 Holm 校正;详细描述了七份不相交数据划分(pilot/训练/探针/求解器门/生成器门/诊断/测试)和接受规则的形式化定义;审计调度、rollout 数量、优化阈值承诺在补充材料中;任务和评估都是公开基准(HealthBench、WritingBench、ResearchQA、LLMEval-Med、EQ-Bench Creative Writing v3)配官方评分器。不利因素:论文正文未见代码/数据/提示词的开源链接,而方法涉及多个角色提示(求解器、生成器、逐条评判器、结构审计器、对比审计器、两个重写器、GPT-5.5 匹配器)的具体措辞对结果影响很大但未全部披露;算力方面,仅 HealthBench+GPT-4o 单设置就约 9.1k 次调用、41.7M token,五基准×三骨干×五种子×多基线的完整复现成本相当高;GPT-5.5 匹配器作为评估组件也增加了依赖。总体看方法定义足够精确可重写实现,但缺开源代码会让第三方完整复现 15 个组合的精确数字有难度。