← 返回 2026-09-08

FlowBalance:验证器锚定的在线推理经验自改进方法 FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience

Zixun Huang, Kishan Panaganti, Haitao Mi, Leowei Liang 📅 2026-09-03 👍 96 2026-09-12 18:30
GFlowNets LLM推理 RLVR 在线策略蒸馏 自改进 轨迹平衡

以验证器优势校准同模型密集自引导,用轨迹平衡拟合归一化目标分布实现自改进。

前置知识

RLVR 与组相对优势(GRPO)

可验证奖励强化学习(RLVR)用自动检查器(如数学最终答案比对)给每条回答打 0/1 奖励。GRPO 对每个提示采样一组 N 条回答,用组内均值和标准差把奖励标准化为优势 $A_i=(R_i-\mu_R)/(\sigma_R+\epsilon)$,不需要学习价值网络,是当前 LLM 推理 RL 的主流做法。

FlowBalance 能量中的验证器项正是这种停止梯度的组相对优势,论文的能量定义、符号门控和四个理论命题都建立在它之上。

轨迹平衡

来自 GFlowNets 的完整轨迹分布匹配条件:要求 $\tau\log Z+\tau\log\frac{\pi_\theta(y|x)}{\pi_{ref}(y|x)}=E(y|x,c)$,即策略与参考策略的对数比加上共同偏移恰好等于轨迹能量。残差为零时 $\pi_\theta$ 精确采样与 $\pi_{ref}\exp(E/\tau)$ 成正比的归一化分布,比逐 token 代理目标更适合长序列信用分配。

FlowBalance 用轨迹平衡残差平方作为唯一的策略更新损失,理解它才能理解论文“分布匹配而非逐 token 模仿”的核心立场。

特权后见之明自引导

训练时把参考解答或任务反馈 $c$ 喂给当前策略的冻结副本 $\pi_H(\cdot|s_t,c)$,让它对已采样轨迹逐 token 打分。该视图在推理时不可用(信息是特权的),但提供密集的逐 token 证据,只需几次前向传播,不需要更大的外部教师模型。

这是密集引导分数 $G_H$ 的来源,也是论文要“驯服”的对象——密集但可能错误自信,正是符号门控要解决的问题。

反向 KL 与参考策略

反向 KL 散度 $\mathrm{KL}(p\|\pi_{ref})$ 度量新分布偏离固定参考分布的程度。FlowBalance 把参考策略固定为初始检查点副本,用于确定目标分布的支持集并约束漂移幅度;命题 2 证明其目标是所有达到既定能量水平的分布中反向 KL 位移最小的唯一一个。

“最小改变的自更新”是论文保守性主张的数学表述,也是它区别于激进 RL 更新的关键卖点。

配分函数与 profiled 估计

能量到概率的转换依赖归一化常数:$p^*(y)\propto\pi_{ref}(y)\exp(E(y)/\tau)$,分母 $Z$ 是配分函数,在完整响应空间精确计算不可行。FlowBalance 在每个 rollout 组内取 $\log\hat{Z}_i$ 的组均值来估计它,只吸收共同偏移、保留全部组内对比。

profiled 分区是方法最具辨识度的工程设计,命题 1 关于保留 $N-1$ 个组内对比的结论以及实现的低成本都源于此。

研究动机

推理模型自我改进的内环有两个脆弱点。其一是验证器稀疏:RLVR/GRPO 只对每条回答给一个终端奖励,而一条数学推理往往包含数百到数千个 token,组相对方法也只是把这个响应级信号摊到每个 token 决策上,无法利用采样路径中间的细粒度证据;FlowRL 等分布方法改进了终端证据到概率的转换,但纯结果能量同样用不上路径内信息。其二是密集自引导不可信:OPSD、RLSD 用带参考答案的训练时视图产生逐 token 信号,但它可能偏爱看似合理却最终被验证拒绝的轨迹、缩短推理、压制不确定性驱动的探索、把更新集中到狭窄的局部模式,形成自我确认——模型自己的错误偏好成为下一轮监督的来源。论文实验直观展示了后果:直接 OPSD 在 Qwen3-8B 上五基准平均只有 41.16,远低于 GRPO 的 65.49,且响应长度迅速坍缩到短回答;合成诊断中,不加校准的自引导把鲁棒成功模式的概率质量压到 0.327,而校准后可达 0.440。

本文的目标是论文提出一个明确的分布学习问题:给定在线策略经验、稀疏但可靠的验证结果、密集但有缺陷的自引导,下一版策略应该学习怎样的归一化响应分布?目标可拆成三点。第一,构造一个把验证器组相对优势与特权后见之明引导合成单一轨迹能量的自改进算子,让密集信号只能在验证器划定的方向内做细化,而不是覆盖方向;第二,以完整的归一化分布(而非逐 token 模仿损失)作为更新对象,用轨迹平衡把能量转成概率守恒的目标,并给出保留组内对比、最小反向 KL 位移、验证器单调控制、假阳性精确纠正等目标层面的理论保证;第三,在 Qwen3-4B 和 Qwen3-8B 的数学推理上同时超过 GRPO、OPSD、RLSD、FlowRL 四个基线,训练更快更稳、避免响应长度坍缩、保持正确策略的语义多样性。

与已有工作不同的是,现有工作分三条线,FlowBalance 与每条都有本质区别。GRPO 代表验证器 RL:方向可靠但监督停留在响应级,不含任何密集信号。RLSD/OPSD 代表 RL 叠加密集自引导:把同模型或特权教师的 token 级项直接插入 RL 目标或作为模仿损失;FlowBalance 明确拒绝单独的 token 级模仿损失,密集证据只作为停止梯度的能量特征进入目标定义。FlowRL/GFlowRL 代表轨迹平衡分布匹配:更新对象已是归一化分布,但能量只用结果优势,浪费了路径内证据。FlowBalance 的独特切入是“结果校准的自引导”:用组相对优势的符号 $\mathrm{sgn}(A)$ 决定密集增益 $G_H$ 的方向——正优势保留、负优势反转、零优势关闭——再经参考策略支持的指数倾斜与 profiled 分区拟合成完整响应分布。这改变了策略更新的对象本身:从局部优化信号变成显式归一化的响应分布,而不是给 GRPO 加监督或给 RL 加一项引导。

核心方法

直觉上,FlowBalance 让验证器管方向、后见之明管细节:只有验证器确认这条轨迹好,密集引导才被用来强化它;验证器判坏时,同样的正引导被反转成惩罚;组内无偏好时干脆关闭,杜绝自我确认。技术上,每个训练迭代先快照当前策略为 $\pi_{\theta^-}$,用它对每个提示采 $N$ 条回答组成 rollout 组;验证器给出停止梯度的组相对优势 $A_i=(R_i-\mu_R)/(\sigma_R+\epsilon)$;冻结的特权视图 $\pi_H$ 对照参考策略 $\pi_{ref}$ 打出逐 token 对数概率增益并取轨迹均值 $G_H$。二者合成能量 $E=\eta_A A+\beta_G G_H\,\mathrm{sgn}(A)$,经 $\pi_{ref}(y|x)\exp(E/\tau)$ 指数加权成参考支撑的吉布斯目标分布,最后用每组一个 $\log Z$ 估计的轨迹平衡残差平方和更新 $\pi_\theta$,梯度只经过 $\log\pi_\theta(y|x)$,奖励、优势、引导分数和采样回答全部停止梯度。

核心创新是结果校准的自引导能量:$E_{FlowBalance}(y|x,c)=\eta_A A(y)+\beta_G G_H(y|x,c)\,\mathrm{sgn}(A(y))$。与 RLSD 把密集引导当独立监督不同,这里 $G_H$ 只是能量里的一个停止梯度特征;策略唯一的学习目标是归一化完整响应分布的轨迹平衡目标 $p^*\propto\pi_{ref}\exp(E/\tau)$,分区项保证概率守恒,使自引导只能在验证器方向内细化分布而不成为独立的局部损失。符号门控带来一个精确性质(命题 4):同一组内对被拒回答 $y^-$ 的假阳性引导,会把验证成功 $y^+$ 与 $y^-$ 的目标概率比相对无门控情形放大 $\exp(2\beta_G G_H(y^-|x,c)/\tau)$ 倍——被自信打分的失败轨迹不但不能自我强化,反而变成偏向成功回答的修正。这与 GRPO(无密集信号)、OPSD(直接模仿特权教师,导致响应长度坍缩)、FlowRL(仅结果能量的轨迹平衡)都构成实质性区别。

方法步骤详情

算法 1 流程:第一步,迭代开始时快照 $\theta^-\leftarrow\theta$ 得冻结 rollout 策略 $\pi_{\theta^-}$,参考策略 $\pi_{ref}$ 固定为初始检查点副本。第二步,从提示—上下文数据集采小批量 $(x_b,c_b)$,$c_b$ 为参考解答等训练期特权上下文。第三步,每提示用 $\pi_{\theta^-}$ 生成 $N$ 条回答组成 rollout 组。第四步,验证器给终端奖励 $R_i$,计算停止梯度的组相对优势 $A_i=(R_i-\mu_R(x))/(\sigma_R(x)+\epsilon)$。第五步,用 $\pi_{\theta^-}$、$\pi_{ref}$ 和特权视图 $\pi_H$ 给已采样 token 打分:$\delta^H_t=\mathrm{clip}(\log\pi_H(y_t|s_t,c)-\log\pi_{ref}(y_t|s_t),-B,B)$,轨迹平均得 $G_H$,全程无梯度、无重采样。第六步,合成能量 $E_i=\eta_A A_i+\beta_G G_H\,\mathrm{sgn}(A_i)$。第七步,profiled 分区:$\log\hat{Z}_i=E_i/\tau-\log\frac{\pi_\theta(y^{(i)}|x)}{\pi_{ref}(y^{(i)}|x)}$,取组均值 $\log\hat{Z}$ 且梯度停止。第八步,残差 $\Delta_{TB}=\tau\log\hat{Z}+\tau\log\frac{\pi_\theta(y|x)}{\pi_{ref}(y|x)}-E$,损失为组内均值 $\frac{1}{2N}\sum_i\Delta_{TB}^2$,梯度只经过 $\log\pi_\theta$。附录还给出子轨迹平衡扩展(式 19-20):把成形增量 $\frac{\beta_G}{T}\delta^H_t\,\mathrm{sgn}(A)+\eta_A A\mathbb{1}\{t=T\}$ 用于区间级残差,为长回答提供更密的拟合信号,但主实验只用完整响应版本。

技术新颖性

技术新颖性体现在四个层面。第一,profiled 分区:每组只估一个标量 $\log Z$,但命题 1 证明它恰好只吸收共同的提示级偏移,保留全部 $N-1$ 个组内独立概率对比,组归一化不会把 rollout 组塌缩成单一比较;$N=32$ 时这种全对比估计的局部高斯参数风险只有每组单对比估计的 2.92%,约为 1/34。第二,目标层面的最小改变刻画:命题 2 证明 FlowBalance 目标是在达到其复合能量水平的组分布中相对参考策略反向 KL 位移唯一的极小点;合成诊断显示,同能量全支撑替代方案需反向 KL 0.973,而指数倾斜只需 0.273(3.6 倍差距)。第三,验证器显式控制:命题 3 给出 $\partial\,\mathbb{E}_{p^*}[R]/\partial\eta_A=\mathrm{Var}_{p^*}(R)/(\tau(\sigma_R+\epsilon))\ge 0$,固定引导时加大验证器权重单调提升目标期望奖励。第四,假阳性精确纠正:命题 4 的 $\exp(2\beta_G G_H/\tau)$ 比例因子是解析结果而非启发式过滤。子轨迹平衡变体进一步把同一原理延伸到中间状态,为长回答的密集信用分配留出接口。

FlowBalance as a verifier-grounded self-improvement cycle.
Figure 1: FlowBalance as a verifier-grounded self-improvement cycle.
FlowBalance: verifier-grounded self-improvement from on-policy experience
Algorithm 1: FlowBalance: verifier-grounded self-improvement from on-policy experience

实验结果

主实验(表 1,step-180,五种子)显示 FlowBalance 全面领先。Qwen3-8B:五基准平均 67.61 且每个基准最优——AIME24@16 89.33、HMMT25 34.67、Minerva 53.68、MATH500 93.52、OlympiadBench 66.85,比 GRPO 65.49 高 2.12、比 FlowRL 65.85 高 1.76、比 RLSD 64.12 高 3.49、比 OPSD 41.16 高 26.45。Qwen3-4B:平均 64.26(AIME24@16 达 80.00±0.00),比 GRPO 62.31 高 1.95、比 FlowRL 63.22 高 1.04、比 RLSD 59.55 高 4.71。核心四基准平均 4B 为 67.69 对 GRPO 65.10(+2.60)、8B 为 71.09 对 68.65(+2.44)。训练动态(图 2):约 100 步达到 0.5 AIME24 验证精度(GRPO 约 143 步,1.43 倍加速),400 步内保持峰值附近而 GRPO 约 180 步后急剧退化,并避免 OPSD 的响应长度坍缩。消融(表 2/3):$\eta_A\in\{5,10,15\}$ 平均 65.65/65.41/67.61,$\beta_G\in\{1,2,3\}$ 平均 67.61/66.48/65.95——验证器权重要足、密集引导宜弱($\beta_G=3$ 使 AIME24 由 89.33 降至 86.00)。合成诊断:四模式成功率 0.900 对仅奖励 0.818、无门控 0.832,鲁棒模式 0.327→0.440;$N=32$ 时 profiled 全对比估计的参数风险仅为单对比估计的 2.92%(约 1/34)。多样性(图 3):正确回答 Simpson 策略多样性 0.2194 对 GRPO 0.1017、RLSD 0.1456;案例(表 4)展示其发现隐藏 $4\times5\times8$ 长方体嵌入解法而非 GRPO 的 Cayley–Menger 行列式路线。

Mathematical reasoning results across Qwen3-4B and Qwen3-8B. AIME24 uses Pass@16; all other benchmarks use Pass@1.
Table 1: Mathematical reasoning results across Qwen3-4B and Qwen3-8B. AIME24 uses Pass@16; all other benchmarks use Pass@1.
Ablation over verifier coefficient $\eta_A$.
Table 2: Ablation over verifier coefficient $\eta_A$.
Ablation over self-guidance coefficient $\beta_G$.
Table 3: Ablation over self-guidance coefficient $\beta_G$.
Case study on AIME24 Problem 23. Boxed spans indicate key reasoning actions in representative correct trajectories.
Table 4: Case study on AIME24 Problem 23. Boxed spans indicate key reasoning actions in representative correct trajectories.
Training dynamics on mathematical reasoning with Qwen3-8B. (a) Training acceleration. (b) Training stability. (c) Response length.
Figure 2: Training dynamics on mathematical reasoning with Qwen3-8B. (a) Training acceleration. (b) Training stability. (c) Response length.
LLM-judged strategy diversity. Correct-only Simpson diversity on AIME24; protocol and scope are given in Appendix D.3.
Figure 3: LLM-judged strategy diversity. Correct-only Simpson diversity on AIME24; protocol and scope are given in Appendix D.3.
查看结构化数据
任务指标本文基线提升
数学推理五基准平均(Qwen3-8B,step-180) AIME24@16、HMMT25/Minerva/MATH500/OlympiadBench@1 平均分 67.61 GRPO 65.49;FlowRL 65.85;RLSD 64.12;OPSD 41.16 +2.12(vs GRPO)/ +1.76(vs FlowRL)/ +3.49(vs RLSD)/ +26.45(vs OPSD)
AIME24 Pass@16(Qwen3-8B) Pass@16 准确率(%) 89.33 ± 1.49 GRPO 85.33;FlowRL 86.67 +4.00(vs GRPO)/ +2.66(vs FlowRL)
HMMT25 Pass@1(Qwen3-8B) Pass@1 准确率(%) 34.67 ± 9.89 GRPO 31.33;FlowRL 30.67 +3.34(vs GRPO)/ +4.00(vs FlowRL)
数学推理五基准平均(Qwen3-4B,step-180) 五基准平均分 64.26 GRPO 62.31;FlowRL 63.22;RLSD 59.55;OPSD 54.12 +1.95(vs GRPO)/ +1.04(vs FlowRL)/ +4.71(vs RLSD)/ +10.14(vs OPSD)
AIME24 Pass@16(Qwen3-4B) Pass@16 准确率(%) 80.00 ± 0.00 GRPO 78.00;FlowRL 75.33 +2.00(vs GRPO)/ +4.67(vs FlowRL)
核心四基准平均(Qwen3-8B) AIME24/HMMT25/MATH500/OlympiadBench 平均分 71.09 GRPO 68.65;RLSD 66.92 +2.44(vs GRPO)/ +4.18(vs RLSD)
AIME24 正确策略多样性诊断 正确回答 Simpson 策略多样性 0.2194 GRPO 0.1017;RLSD 0.1456 +0.1177(vs GRPO,约为其 2.2 倍)

局限与改进

作者承认四点局限:大模型实验只在数学推理上进行,对智能体、多模态等长视野领域的泛化未验证;响应长度对比只是相关性诊断,长回答与高精度的因果关系未建立;多样性分析是单检查点、单种子的 GPT-5.5 评判诊断而非多种子人类研究;实验刻意固定提示分布,FlowBalance 本身不是生成或策展新任务的完整自进化系统。我补充几点观察:其一,符号门控在 $A\approx 0$ 处不连续,优势估计的噪声可能引起能量方向跳变;其二,方法依赖训练期特权上下文 $c$(参考解答或任务反馈),在缺乏标准解答或最终答案无法自动验证的领域难以直接套用;其三,消融只有一维扫描($\eta_A$、$\beta_G$ 各自单独扫),无网格搜索,温度 $\tau$ 和裁剪界 $B$ 未系统消融;其四,主表结果固定在 step-180 报告,长训练下的最优 checkpoint 选择策略未讨论;其五,多样性结论是 LLM 评判的,聚类质量直接影响 Simpson 指数的可靠性。

独立分析的弱点

第一,门控信号二值且依赖奖励标准化:当组内奖励无差异(全对或全错组)时 $A_i\approx 0$,密集分支整体关闭,而长推理任务中全错组并不罕见,此时 $G_H$ 中的信息被完全浪费;改进方向是用 $\tanh(A)$ 等软门控平滑过渡,或在零优势组改用 $G_H$ 的一致性做轻量正则。第二,特权上下文假设过强:数学题有标准解答,但开放域生成、代码审查等场景不一定存在可靠的 $c$;可探索用模型自生成的候选解答加验证器过滤来合成特权上下文。第三,后见之明视图与 rollout 策略同源,若当前模型对某类推理系统性盲视,$G_H$ 提供不了新信息,引导收益会随能力逼近上限而衰减;可引入异源教师或跨迭代快照池增加视角多样性。第四,多样性结论依赖 GPT-5.5 单评判员、单种子,策略聚类的主观性会直接影响 Simpson 指数;应做多评判员一致性检验并报告多种子方差。第五,每个样本需要 $\pi_H$ 与 $\pi_{ref}$ 两次额外前向打分,长回答下计算开销可观;可缓存参考策略分数或只在一部分 token 上估计 $G_H$。第六,$\beta_G$ 从 1 增到 3 就使 AIME24 掉 3.33 分,对超参较敏感,实际使用需要谨慎调参。

未来方向

作者明确提出的方向:把分布更新内环与外环任务生成结合,例如 R-Few 式的 Challenger–Solver 课程系统,同时独立度量任务漂移、策略稳定性与策略多样性;把方法推广到智能体、多模态等长视野领域。基于本文成果可进一步延伸:其一,子轨迹平衡(公式 20)目前只在附录给出形式、未在主实验规模验证,对数千 token 长回答的密集拟合值得系统实验;其二,把 profiled 分区换成学习式提示条件估计器并比较两者的方差与偏差;其三,设计自适应 $\beta_G$ 调度,按验证器覆盖率、组内奖励一致性或 $G_H$ 的可靠性动态调节引导强度;其四,研究只有部分样本可验证的半监督场景下符号门控的扩展;其五,命题层面目前只刻画目标分布性质,神经优化器下的实际收敛保证仍然开放;其六,把多样性从 LLM 评判诊断升级为多种子、人工验证的群体级度量。

复现评估

复现条件总体较好。代码有公开仓库(github.com/alexhuang13/FlowBalance),另有博客 alexhuang13.github.io/FlowBalance-Blog/;骨干模型 Qwen3-4B/8B 开源,五个评测基准(AIME24、HMMT25、Minerva、MATH500、OlympiadBench)均为公开数据集;附录 D.1 的表 5 给出训练与解码细节,并保证同一骨干内所有方法共享训练提示、rollout 组大小、验证器、长度上限、checkpoint 计划和评测脚本,基线 GRPO/OPSD/RLSD/FlowRL 均为已发表方法且有公开实现。主要门槛在算力与工程:RL 训练需要每提示滚动生成 $N$ 条回答、三个视图($\pi_{\theta^-}$、$\pi_{ref}$、$\pi_H$)的前向打分、400 步以上训练,主表报告五种子均值,完整复现两个骨干需要可观的多卡预算;多样性诊断还需调用 GPT-5.5 作为评判员(API 费用),且该部分只有单种子,复现数值会受评判员差异影响。综合评估:中高难度,熟悉主流 RL 训练框架(verl 类)的团队可以复现,单卡研究者只能做小规模验证。