← 返回 2026-08-10

演化评分标准作为奖励的音频推理强化学习 Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning

Fangxu Yu, Tao Feng, Dehai Min, Zinan Lin, Weijia Xu, Michael Xu, Philip S. Yu, Ge Liu, Tianyi Zhou 📅 2026-08-03 👍 13 2026-08-15 18:30
大音频语言模型 强化学习 评分标准奖励 过程监督 音频推理

用自演化的音频接地评分标准做过程级奖励,提升音频推理质量

前置知识

GRPO(Group Relative Policy Optimization,组相对策略优化)

GRPO 是一种为大模型 RL 后训练设计的策略优化算法。对于每个输入,策略模型先采样 G 个候选回答,再用奖励函数对每个回答打分;它不用单独训练 critic 网络,而是用同一组采样内的平均分和标准差对奖励做归一化得到优势函数 $A_i = (r(o_i) - \mathrm{mean}(r(o_j))) / \mathrm{std}(r(o_j))$,最后用策略梯度更新 $\pi_\theta$,并加一个 KL 散度项 $\beta_{KL} D_{KL}(\pi_\theta \| \pi_{ref})$ 防止偏离参考模型。

AUDIORUBRICS 的全部实验都建立在 GRPO 之上,本文提出的演化评分标准奖励最终替换掉了 GRPO 公式里的标量奖励 $r(\cdot)$。不懂 GRPO 就无法理解论文如何把过程级奖励接入训练。

Rubric as Rewards(评分标准作为奖励)

把奖励分解成若干条可二值判定的自然语言准则(rubric),每条准则配一个权重 $w_k$。对一个回答 $y$,由 judge 模型逐条判定是否满足 $J(x, r_k, o) \in \{0,1\}$,最终得分 $S(x,y) = \sum_k w_k J(x, r_k, o)$。rubric 的具体、可枚举特性让奖励比纯黑箱打分更客观,也减少 judge 偏差。

本文的全部创新都围绕『rubric 怎么生成、怎么演化、怎么过滤』展开。这是论文方法层的基础语言,必须先掌握才能理解 evolving rubrics 的设计动机。

RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励强化学习)

RLVR 指奖励信号可以由程序自动判定对错(如数学题答案、选择题选项)的一类 RL 后训练范式,DeepSeek-R1 让它在推理任务上大放异彩。它的奖励通常很稀疏,只监督最终答案是否正确,而不管中间推理过程。

RLVR 是论文的直接改进对象:outcome-based 的 RLVR 只看最终答案,无法约束推理过程是否真正『听了音频』,这是 AUDIORUBRICS 试图解决的核心痛点。

LALM(Large Audio Language Model,大音频语言模型)

LALM 把音频模态接入大语言模型骨干,能对语音、环境声、音乐等音频内容做理解和推理,代表模型包括 Qwen2.5-Omni、Kimi-Audio、Audio-Flamingo 等。它们通常先把音频编码成 token 或 embedding,再与文本 token 一起喂给语言模型。

论文的训练对象就是 LALM(基座为 Qwen2.5-Omni-7B),所有 benchmark 评测和 baseline 对比都围绕 LALM 展开。理解 LALM 的能力边界有助于判断本文改进的实际意义。

音频推理 benchmark(MMAU / MMAR / MMSU)

三个广泛使用的音频理解与推理基准。MMAU Test-mini 含 1000 道覆盖语音/声音/音乐共 27 个任务的选择题;MMAR 包含 1000 条来自真实视频、混合三种模态、按四个推理层级组织的 QA;MMSU 有 5000 条三元组、覆盖 47 个口语任务,专门探测韵律、情感、说话人特征等细粒度副语言与音素线索。

这三个 benchmark 覆盖了从感知到多步推理、从单一模态到混合模态的完整光谱,是论文结论的全部实证依据。知道它们各自侧重什么,才能判断 4.3 个百分点的感知提升到底意味着什么。

Rollout(采样回答)

在 RL 训练中,对同一个输入,让当前策略 $\pi_\theta$ 用温度采样生成多个候选回答(本文 $G=8$ 个)的过程称为 rollout。这些 rollout 组成一个 group,GRPO 通过比较 group 内回答的相对优劣来估计优势函数。

AUDIORUBRICS 的核心机制是『根据当前 rollout 集合生成新 rubric、并丢弃区分度为零的 rubric』。rollout 既是被评估的对象,也是 rubric 演化的输入信号,理解它是理解方法动态性的关键。

研究动机

现有音频推理的 RL 后训练方法存在两类互补的缺陷。第一类是 outcome-based 方法(如 R1-AQA、Omni-R1),只对最终答案正确性给奖励,把推理过程完全放任不管——这会让模型即使答对也不是靠认真听音频,而是靠语言先验猜中,图 1 就展示了 GRPO 基线在『打字机几秒返回』这种题上只给出『18 秒』式浅层猜测,却没有引用音频证据。第二类是 process-based 方法(如 Audio-Reasoner、Audio-Thinker、CESAR),虽然打分了推理过程,但用的是粗粒度、人工设计、对所有问题固定不变的准则:它们既不验证推理是否真的基于声学证据,也不区分不同问题对感知与多步推理的需求差异。更关键的是,固定准则会随策略提升而饱和——一旦模型稳定通过某条准则,这条准则就不再区分强弱回答,梯度信号枯竭,评估标准无法再随模型能力一同成长。

本文的目标是本文要设计一种音频推理 RL 框架,其奖励信号同时满足五个特性:过程级监督(看推理过程而不只看答案)、细粒度准则(多条独立可判定的 rubric)、音频接地(每条准则锚定到片段里真实存在的声学证据)、自动生成(不需要人工逐题设计),以及随策略共同演化(准则随模型变强不断更新到更难的标准)。目标是让训练信号持续针对当前模型的弱点,把音频推理从『浅层猜测』推向『深度、忠实、有证据支撑的解释』。

与已有工作不同的是,作者在 Table 1 里系统对比了 R1-AQA、Omni-R1、Audio-Reasoner、Audio-Thinker、CESAR 五个代表性方法,发现没有任何一个同时具备上述全部五个特性——即便最接近的 CESAR 也只覆盖『过程监督 + 细粒度准则』两点,缺音频接地、自动生成和策略演化。AUDIORUBRICS 的独特切入角度是把 rubric 的演化与策略的 rollout 直接耦合:rubric 不是离线固化好的,而是在每个训练步根据当前策略实际生成的 rollout 集合动态生成、过滤、再加权,让评估标准像棘轮一样只升不降地跟随模型能力。这种『rubric 既是奖励又是诊断工具』的设计是本文区别于所有此前工作的本质点。

核心方法

整体思路可以用三句话概括:先用一个音频模型 $\Phi$ 从原始波形出发为每道题初始化一批『音频接地』的 rubric;再在 GRPO 的每个训练步里,让 $\Phi$ 看到当前策略的 $G=8$ 个 rollout,从中提炼出新的、更难的 rubric,把所有 rollout 都通过或都失败的非判别性 rubric 用方差过滤剔除,对幸存的 rubric 重新分配权重;最后把 rubric 得分、outcome 得分和一个『overthinking 惩罚』加权组合成最终奖励送进 GRPO。直觉上,这相当于让奖励函数本身像一个随堂老师:学生(策略)变强后,老师就把题目出得更难、更针对学生当前的盲点,而不是反复考同一套已经做烂的卷子。技术路线则围绕奖励函数的设计展开——outcome 奖励保证答案正确性底线,rubric 奖励提供稠密的过程级监督,overthinking 惩罚约束推理长度,三者构成互补三角。

核心创新点是『evolving rubrics(演化评分标准)』:rubric 不再是静态的、对所有样本一刀切的,而是每个训练步、每个 prompt group 内根据当前 rollout 重新生成和过滤。这区别于所有此前工作的本质在于三点。第一,rubric 由模型自身的 rollout 诱导而来,因而能携带『负向准则』(满足即缺陷),捕捉正向准则无法表达的反复失败模式。第二,方差过滤 $s_k = \mathrm{std}_i(b_{k,i})$ 把所有 rollout 都通过(说明策略已掌握)或都失败(说明超出能力)的准则直接丢弃,因为它们对组内优势函数贡献为零,等价于自动剔除饱和信号。第三,幸存 rubric 的集合从上一步继承($R_{prev}$),并叠加新提炼的更难准则,使评估标准像棘轮一样只升不降——这正是让奖励信号能持续跟踪模型弱点、避免饱和的机制。

方法步骤详情

完整方法分为四个阶段。(1)音频接地 rubric 初始化:训练前,对每道题调用 $\Phi(A, Q, y^*; \mathcal{F})$,把原始波形 $A$(不是文本转写)、问题 $Q$、答案 $y^*$ 和预设的 $K=5$ 个评估维度 $\mathcal{F}$(听觉证据接地、跨线索验证与干扰项排除、推理清晰度、推理聚焦度、领域专用音频技术)输入,输出 $\mathcal{R}^0 = \{(r_k, w_k)\}_{k=1}^K$,每条 $r_k$ 是正向二值陈述,权重和为 1。(2)演化与判定:每个训练步,$\Phi$ 看到 $A, Q$、上一步继承的 $R_{prev}$(首次迭代取 $\mathcal{R}^0$)和当前 rollout $\{o_i\}_{i=1}^G$,生成至多 $N_{new}=3$ 条新 rubric,并对所有 rubric(旧+新)在每个 rollout 上输出二值判定 $j_{k,i} \in \{0,1\}$;负向 rubric 的判定做极性翻转 $b_{k,i} = 1 - j_{k,i}$。(3)方差过滤:计算每条 rubric 的组内标准差 $s_k$,丢弃 $s_k = 0$ 的;若幸存集为空则给所有 rollout 中性奖励 0.5(不产生优势);否则保留 $s_k$ 最高的 $M=5$ 条,记为集合 $\mathcal{K}$ 并作为下一轮的 $R_{prev}$。(4)重加权与打分:$\Phi$ 再次被调用对 $\mathcal{K}$ 重新分配权重 $\sum_{k \in \mathcal{K}} w_k = 1$,rubric 奖励 $R^i_{rub} = \sum_{k \in \mathcal{K}} w_k b_{k,i}$。最终奖励 $R_i = R^i_{out} + \gamma R^i_{rub} + \delta R^i_{over}$,其中 $R^i_{out} = \alpha R^i_{acc} + \beta R^i_{fmt}$($\alpha=0.9, \beta=0.1$)、overthinking 惩罚 $R^i_{over} = 1 - |o_i|/L$($L=256$),代入 GRPO 目标 $\max_{\pi_\theta} \mathbb{E} [R_i - \beta_{KL} D_{KL}(\pi_\theta \| \pi_{ref})]$ 优化。

技术新颖性

技术新颖性集中在四个点。第一,把 rubric 演化机制首次引入音频推理:此前 rubric-as-reward 工作主要面向纯文本或视觉语言任务(如 Jia 等 2025、Yu 等 2026d),本文针对音频的多模态接地需求设计了『声学证据接地』为核心维度的 rubric 体系。第二,用方差过滤实现自动饱和检测:不需要人为判断某条准则是否过时,组内标准差为零即剔除,这在数学上等价于『该准则不贡献优势』。第三,引入负向 rubric:演化 rubric 由 rollout 诱导,能表达『幻觉了音频内容』『被文本先验覆盖了音频证据』这类正向准则无法表达的失败模式,这是过程奖励能区分『答对但靠猜』与『答错但推理扎实』的关键。第四,overthinking 惩罚解决了 rubric 奖励天然诱导冗长推理的副作用——图 7 显示去掉它会让回答长度爆炸式增长,纯 GRPO 又会让长度塌缩到接近零,只有完整方法把长度稳定在合理区间。

AUDIORUBRICS 整体框架:rubric 初始化、rollout 采样、rubric 演化与判定、奖励组合、GRPO 更新
Figure 2: AUDIORUBRICS 整体框架:rubric 初始化、rollout 采样、rubric 演化与判定、奖励组合、GRPO 更新
GRPO 基线与 AUDIORUBRICS 在『叔叔为什么说最后一句话』案例上的定性对比
Figure 5: GRPO 基线与 AUDIORUBRICS 在『叔叔为什么说最后一句话』案例上的定性对比
rubric 共演化的定性案例:『音频发生在哪里』
Figure 6: rubric 共演化的定性案例:『音频发生在哪里』

实验结果

论文在三个 benchmark 上做了充分实验,结论非常稳健。在主结果(Table 2、Table 3)上,AUDIORUBRICS 在 MMAU Test-mini 取得 78.00%,超过 Gemini-3.1-Pro(77.60%)、CESAR(77.10%)、GRPO 基线(75.20%),且在 Sound 类别上以 85.89% 跨所有受评模型排名第一;在 MMAR 取得 65.80%,领先 Audio-Thinker(65.30%)和 CESAR(62.70%),Sound 类别 68.48% 同样为同规模模型最佳;在 MMSU 取得 65.86%,超过 CESAR(64.24%)和 GRPO(63.14%)。感知能力的提升尤其亮眼——MMSU 感知分项平均 52.75%,比最强同规模基线 CESAR 高出 4.3 个百分点(8.9% 相对提升),三个感知维度(语义、音素、副语言)全面领先,证明把监督锚定到声学证据确实转化为真实的感知增益。在奖励权重敏感性分析(Table 4、Figure 3a)上,加入 rubric 奖励在所有 $\gamma$ 取值上都优于 GRPO,最优 $\gamma=0.5$ 让三个 benchmark 同步提升;但超过 0.5 后因过度压制 accuracy 奖励反而下降,说明 rubric 与 outcome 必须平衡。overthinking 惩罚 $\delta$ 的最优值是 0.15(Table 5),过小会让推理冗长拖累准确率,过大会过度压缩推理。generator/judge 选型至关重要(Figure 3b、3c):用较弱的 GPT-audio-1.5 替换 Gemini-3.1-Pro 反而掉到 GRPO 基线以下,原因是低质 rubric 带来噪声奖励。消融(Table 6)逐项剥离证明 RL 训练(65.20→75.20 MMAU)、static rubrics(+1.0)、evolving rubrics(+1.0)、length penalty(+0.8)各自都有贡献。在 3B 模型上(Table 8)方法依旧有效,MMAU/MMAR/MMSU 分别相对提升 1.23%/1.72%/3.65%,说明对模型规模稳健。图 4 显示演化 rubric 的采纳比例从训练初期约 35% 增长到末期约 60%,直观印证『rubric 集合随策略升级』。

AUDIORUBRICS 与现有音频推理后训练设计在五个维度上的对比
Table 1: AUDIORUBRICS 与现有音频推理后训练设计在五个维度上的对比
MMSU 和 MMAU Test-mini 上各模型准确率,前两名加粗和下划线
Table 2: MMSU 和 MMAU Test-mini 上各模型准确率,前两名加粗和下划线
MMAR benchmark 上的结果,按单模态和混合模态拆分
Table 3: MMAR benchmark 上的结果,按单模态和混合模态拆分
不同 rubric 奖励权重 $\gamma$ 下三 benchmark 准确率与相对提升
Table 4: 不同 rubric 奖励权重 $\gamma$ 下三 benchmark 准确率与相对提升
不同 overthinking 惩罚权重 $\delta$ 下三 benchmark 准确率与相对提升
Table 5: 不同 overthinking 惩罚权重 $\delta$ 下三 benchmark 准确率与相对提升
AUDIORUBRICS 各组件的消融实验
Table 6: AUDIORUBRICS 各组件的消融实验
3B 模型上 AUDIORUBRICS 与 GRPO 的对比
Table 8: 3B 模型上 AUDIORUBRICS 与 GRPO 的对比
(a) 不同 rubric 奖励权重 $\gamma$ 下三 benchmark 平均性能;(b) 不同 generator/judge 下三 benchmark 准确率;(c) 训练过程中 accuracy 奖励的动态曲线
Figure 3: (a) 不同 rubric 奖励权重 $\gamma$ 下三 benchmark 平均性能;(b) 不同 generator/judge 下三 benchmark 准确率;(c) 训练过程中 accuracy 奖励的动态曲线
训练过程中被采纳的演化 rubric 比例
Figure 4: 训练过程中被采纳的演化 rubric 比例
三种奖励配置下训练过程中的平均回答长度动态
Figure 7: 三种奖励配置下训练过程中的平均回答长度动态
查看结构化数据
任务指标本文基线提升
MMAU Test-mini 整体准确率(1000道选择题,覆盖语音/声音/音乐27任务) Accuracy (%) 78.00 CESAR 77.10 / GRPO 75.20 / Gemini-3.1-Pro 77.60 比 GRPO +2.80 个百分点(+3.72% 相对);Sound 子项 85.89% 跨所有模型第一
MMAR 深度推理(1000条混合模态真实视频QA,四层推理) Accuracy (%) 65.80 Audio-Thinker 65.30 / CESAR 62.70 / GRPO 62.20 比 GRPO +3.60 个百分点(+5.79% 相对);Sound 68.48% 为同规模最佳
MMSU 口语理解(5000条三元组,47个副语言/音素任务) Accuracy (%) 65.86 CESAR 64.24 / GRPO 63.14 比 GRPO +2.72 个百分点(+4.31% 相对);感知平均 52.75%,+4.3 点(+8.9% 相对)
3B 模型上方法可迁移性 Accuracy 相对提升 (%) MMAU 73.90 / MMAR 59.30 / MMSU 62.46 GRPO 73.00 / 58.30 / 60.26 三 benchmark 分别 +1.23% / +1.72% / +3.65% 相对

局限与改进

作者自己承认的主要局限是方法高度依赖一个足够强的 generator/judge:图 3b、3c 显示用 GPT-audio-1.5 替代 Gemini-3.1-Pro 后性能掉到 GRPO 基线之下,说明 rubric 质量是方法成立的前提,这把方法的可复制性绑死在了闭源顶级模型上。训练成本也是一个隐含问题——每个 prompt group 在每个训练步都要调用 $\Phi$ 做生成 + 判定 + 加权三次,开销远高于纯 outcome RLVR。我自己观察到的局限还有:评测全部用贪心解码($\tau=0$)和准确率单一指标,没有报告困惑度、推理可解释性或人评忠实度,无法验证 rubric 奖励是否真的减少了音频幻觉而非只是更会写论证;训练数据仅来自 AVQA(40,176 条)一个来源,泛化到医疗、多媒体分析等真实场景尚未验证;rubric 维度固定为 5 类,对极简单感知题和极复杂多步推理题用同一套维度生成 rubric,可能并非最优。

独立分析的弱点

第一个弱点是 generator/judge 的强依赖性(图 3b、3c)。改进方向:可以用 self-consistency 或多 judge 投票降低单次判定的噪声,或者用更小的开源模型配合蒸馏 rubric 数据来替代 Gemini-3.1-Pro,让方法摆脱闭源依赖。第二个弱点是 rubric 数量和维度硬编码($K=5$、$M=5$、$N_{new}=3$)。改进方向:把 $K$ 和 $M$ 做成随题目难度自适应的,简单感知题用 2-3 条 rubric 避免过度计算和幻觉,复杂推理题用更多 rubric 覆盖逻辑链每一环。第三个弱点是 overthinking 惩罚用线性 $1-|o_i|/L$,这种线性形式对长度敏感且 $L=256$ 是全局常数,无法针对不同题目调整。改进方向:换成基于信息密度或基于 rubric 命中密度的自适应惩罚,让『短而精』和『长而必要』都得到合理奖励。第四个弱点是奖励设计的三个权重 $\gamma, \delta$ 需要人工调参(论文选 0.5 和 0.15),没有自适应机制。改进方向:用元学习或基于训练曲线的自动调度,让权重随训练阶段演化。第五个弱点是训练数据单一(仅 AVQA),改进方向是引入 MMAU/MMAR/MMMSU 训练分割或多源混合数据增强泛化。

未来方向

作者明确提及的方向是把 evolving rubrics 思路推广到更多模态——相关工作部分指出本文是首次把演化 rubric 引入音频,类比此前在视觉语言(Jia 2025、Yu 2026d)和全模态(Kong 2026)上的进展,下一步自然是视频、全模态乃至具身场景。基于本文成果可延伸的研究方向还包括:(1)把 rubric 生成器与策略本身做共同训练,让 rubric 生成也获得梯度,而不是依赖外部 $\Phi$;(2)探索 rubric 的可解释性与可迁移性——同一类问题学到的 rubric 是否能跨数据集复用,从而降低每题重新生成的开销;(3)研究 rubric 奖励与人类对齐的关系,比如能否用 rubric 演化自动逼近人类偏好,减少对 RLHF 标注的依赖;(4)把方法拓展到开放式生成任务(非选择题),那里没有可验证答案,rubric 奖励将是唯一监督信号,本文的 outcome 奖励 $R_{out}$ 需要被替换。

复现评估

复现友好度中等偏上。有利因素:作者承诺开放模型权重和数据集、提供完整代码,论文 Appendix A(Table 7)列出了全部关键超参(基座 Qwen2.5-Omni-7B、GRPO 400 步、batch 8、lr $1 \times 10^{-6}$、$\beta_{KL}=0.001$、$G=8$、$\alpha=0.9, \beta=0.1, \gamma=0.5, \delta=0.15$、$L=256$、$M=5$、$N_{new}=3$),训练数据 AVQA 公开可获取并给出了从视频提取音频的具体做法(40,176 条),硬件门槛明确(4 张 H100 GPU),Appendix D 还公开了 5 个完整 prompt(推理 prompt、静态 rubric 生成、演化 rubric 系统+判定、权重分配),Algorithm 1 给出了伪代码。主要障碍有两点:一是 generator/judge 依赖 Gemini-3.1-Pro 这个闭源模型,弱模型(GPT-audio-1.5)会让性能掉到基线以下,意味着复现者必须能稳定访问 Gemini-3.1-Pro 且每次训练都要调用大量 API(每个 prompt group 每步三次调用,成本和延迟都很高);二是训练数据虽然公开但来自视频,重新提取音频到 40,176 条样本需要额外工程。综合判断:在拿到代码和权重后,用同等算力和 API 访问可以复现主结果,但完全独立复现(包括 rubric 生成阶段)成本不低。