TTPO:测试时策略优化 TTPO: Test-Time Policy Optimization
利用伪标签错误的非对称性,无标签地将自蒸馏与RL惩罚结合于测试时训练
前置知识
GRPO(组相对策略优化)
DeepSeekMath 提出的 RLVR 算法:对每个问题采样一组(如 K 条)回答,用组内奖励的均值和标准差归一化得到每个回答的优势 $A_k = (r_k - \bar{r})/\sigma$,无需价值网络。奖励高于组均值的轨迹被加强、低于均值的被抑制。在 TTPO 中 GRPO 仅作用于与伪标签不一致的负样本,其 $A_k<0$,从而形成对错误轨迹的惩罚项。
TTPO 的负样本分支直接构建在 GRPO 的组相对优势之上,不懂 GRPO 就无法理解惩罚项 $\mathcal{L}_{GRPO}$ 的构造方式与其'不使用伪标签内容'的鲁棒性来源。
OPSD(在线策略自蒸馏)
用同一个模型同时充当教师与学生:教师以答案作为特权信息拼入提示并开启思考模式,学生只见问题;对模型自己采样的轨迹逐 token 计算师生分布的前向 KL 散度 $\mathrm{KL}(q_t\|p_t)$ 并最小化,提供比单个序列级奖励细得多的 token 级稠密监督。教师前向不回传梯度,训练时教师固定为基础模型权重。
TTPO 的正样本分支就是 OPSD,只是把真实答案换成多数投票伪标签;论文关于特权信息形式、思考教师等关键消融都围绕 OPSD 展开。
测试时训练(TTT)
在推理阶段直接用待求解的测试问题本身(无任何标签)对模型进行训练,让模型在'它必须解决的题目'上自我提升。对 LLM 推理,典型代表是 TTRL:每题采样多条轨迹,多数投票产生伪标签作为二值奖励,再用 GRPO 训练。
本文的目标场景就是 TTT——训练集即测试集、标签永远不到来,这决定了'伪标签约85%是错的'是常态而非例外,是全文动机的数据基础。
前向 KL 散度(Forward KL)
衡量教师分布 $q$ 与学生分布 $p$ 差异的量:$\mathrm{KL}(q\|p)=\sum_v q(v)\log\frac{q(v)}{p(v)}$,按教师分布加权,学生会努力覆盖教师所有高概率 token。OPSD 对轨迹上每个 token 计算该量并取平均作为蒸馏损失,属于分布级稠密信号。
附录 E 的理论分析表明:正样本上前向 KL 退化为安全的'思考→非思考'蒸馏;负样本上则出现冲突项 $\Delta_{\text{conflict}}\ge 0$,这正是非对称设计的理论依据。
多数投票伪标签
无标签自我监督的来源:对每题采样 K 条回答,提取最终答案并按数学等价性聚类,取最大簇的答案作为伪标签 $\hat{a}$,簇大小即共识度。竞赛级难题上伪标签错误率高达约85%,但与伪标签不一致的 rollout 中约79%自己也是错的。
TTPO 的一切设计(正负划分、分支路由、自进化)都建立在伪标签之上,'标签错但惩罚仍对'的非对称性直接来自这两个统计数字。
负学习(Negative Learning)
噪声标签学习中的经典思想:与其告诉模型样本'是什么'(标签可能错),不如告诉它'不是什么'——即使标签错误,'非某类'的陈述通常仍然可靠。TTPO 对不一致样本的 GRPO 惩罚是这一思想在 RL 场景的版本:惩罚只依赖'与多数簇不一致'这一事实。
理解负学习才能理解论文的核心论点:为什么惩罚比蒸馏更耐噪,以及为什么非对称路由能把伪标签错误的影响限制在小部分正样本内。
研究动机
当前两类主流后训练方法都依赖真实标签:RLVR(如 GRPO)需要真实答案做奖励验证,OPSD 需要真实答案作为教师提示中的特权信息。一旦进入测试时训练(TTT)场景——模型要在没有任何标签的测试题上自我提升——这些方法全部失效。用多数投票伪标签替代真实答案看似自然(TTRL 即用伪标签做 RL 奖励),但非常脆弱:在 AIME 2026 上用 Qwen3-1.7B 统计,竞赛级难题的伪标签约 85% 是错的。更糟的是,稠密信号会放大错误:错误的标量奖励每条轨迹只误导一次,而错误答案进入答案条件化教师后会在每个 token 上误导学生——向伪标签教师全量蒸馏时污染面覆盖全部 K 条轨迹;只蒸馏不一致轨迹的变体则会在模型本已答对时主动压制正确推理。因此无标签场景下的核心矛盾是:多数投票既是最容易获得的监督来源,又是高频出错的不可靠信号。
本文的目标是本文的目标是在完全无标签的测试时训练设定下,让模型在竞赛级数学推理上达到甚至超越真实标签监督方法的水平,具体分解为四个可验证的子目标。一是在 OpenThoughts 有标签训练集上,TTPO 完全不使用标签,仍要与使用真实标签的 GRPO 和 OPSD 打平或更好(最终三个尺度平均分别为 40.1/58.6/62.6,均超过标签版 OPSD 的 39.7/58.4/61.7)。二是在纯 TTT 设定(直接在测试题上训练)中大幅超越 TTRL 和 OPSD-TTT 等无标签基线,将 Qwen3-1.7B 在 AIME26/HMMT26/BRUMO25 上的平均准确率从 38.0% 提升到 45.2%。三是关闭思考模式评估时获得大幅迁移增益(三个尺度 +25.2/+30.6/+36.4 个点),证明模型真正吸收了思考型教师的推理能力而非记住题目。四是展示跨基准泛化与自我进化:训练信号随模型变强而变好,能突破初始多数投票的共识上限。
与已有工作不同的是,本文的独特切入是对伪标签错误'非对称性'的实证观察与利用:即使伪标签 $\hat{a}$ 是错的(约85%的提示上如此),与它不一致的 rollout 中约 79% 自己也是错的——其答案既不是 $\hat{a}$ 也不是真实答案 $a^*$。这意味着惩罚不一致样本几乎总是正确的,因为惩罚只依赖'不一致'这一事实,从不使用伪标签的内容,与伪标签对错无关;相反,向伪标签条件化教师蒸馏则毫无这种容错性,错误答案进入教师后污染每个 token。此前工作要么把伪标签压成标量奖励(TTRL,浪费稠密信号),要么把伪标签塞进教师做全量或选择性蒸馏(错误被放大)。TTPO 首次把'负学习对噪声标签鲁棒'的思想引入 LLM 测试时训练,按每种信号的可靠区域分别投放蒸馏与惩罚形成非对称目标,再通过两个分支各自的 token 级选择继续降噪,并用组相对优势的统计性质保证随模型提升信号自动变准的自进化循环。
核心方法
TTPO 的直觉是:把每种训练信号用在它可靠的地方,而不是追求单一统一损失。流程分五步。第一步伪标签化:每题采样 K=64 条轨迹(温度 1.1、最长 16,000 token 避免截断导致答案抽取失败),提取答案并按数学等价性聚类,最大簇为伪标签 $\hat{a}$,据此划分正样本集合 $P$(与 $\hat{a}$ 一致)和负样本集合 $N$(不一致)。第二步构造教师与学生:同一模型,教师把 $\hat{a}$ 作为特权信息拼入提示并开启思考模式(前向不回传梯度,LoRA 关闭即基础权重),学生只见问题。第三步对正样本做 OPSD 分支:逐 token 前向 KL 蒸馏,并用 Soft-OR 权重 $w^{(t)}=\hat{H}^{(t)}+\hat{\Delta}^{(t)}-\hat{H}^{(t)}\hat{\Delta}^{(t)}$ 降权学生已收敛的位置($H$ 为学生熵、$\Delta$ 为师生散度,均逐样本 min-max 归一化)。第四步对负样本做 GRPO 分支:组相对优势 $A_k<0$ 形成惩罚,用得分 $s^{(t)}=-\log p_\theta(y_k^{(t)})\cdot(1-\hat{H}^{(t)})$ 选 top-50% token 做掩码,只罚'自信的错误'。第五步合并:$\mathcal{L}_{TTPO}=\frac{1}{|B|}\left(\sum_{k\in P}\mathcal{L}_{OPSD}+\lambda\sum_{k\in N}\mathcal{L}_{GRPO}\right)$,$\lambda=0.1$ 平衡两支约一个数量级的梯度差异。
核心创新是非对称目标:正样本(同意伪标签)用 OPSD 蒸馏、负样本(不同意)用 GRPO 惩罚,本质区别在于对伪标签错误'爆炸半径'的控制。附录 E 的分解显示:正样本上由于轨迹答案本来就等于 $\hat{a}$,教师的条件化压力消失,前向 KL 退化为纯'思考→非思考'蒸馏,即使 $\hat{a}$ 错也无害(消融中 45.7 vs 无特权 45.8);若对负样本做 FKL,则会出现冲突项 $\Delta_{\text{conflict}}\ge 0$,当 $a_k=a^*\ne\hat{a}$ 时会主动压制正确推理。GRPO 惩罚正好相反:它只要求'不在多数簇'这一事实,不使用 $\hat{a}$ 的内容,而负样本约79%确实该罚,所以几乎总是安全。反向指派(正样本 GRPO、负样本 FKL)在消融中垫底(AIME26 上 37.2 vs 完整 TTPO 48.9),直接定量验证了设计。两个分支内再做 token 级选择:蒸馏端降权低熵低散度的已收敛位置、避免稀释有效梯度;惩罚端用未归一化的 $-\log p$ 锚定排序、掩掉高概率的正常 token,只罚低概率低熵的异常输出,弥补非对称框架下缺失的正优势抵消。
方法步骤详情
完整流程见 Algorithm 1。(1) 伪标签化:每题 K=64 条采样提取答案、聚类等价类得伪标签 $\hat{a}$ 与正/负划分;从 K 条中选 8 条进训练批——固定 50/50 配比、优先最短轨迹(梯度只更新前 1,024 token,短轨迹的关键推理更可能落在窗口内)。(2) 教师与学生前向:教师以 $[x;\hat{a}]$ 加思考模板前向得 $q_t$(no grad),学生以 $x$ 前向得 $p_t$(with grad),共享补全 $y_{<t}$。(3) OPSD 分支:$\mathcal{L}_{OPSD}=\frac{1}{T_k}\sum_t w^{(t)}\,\mathrm{KL}(q_t\|p_t)$,$w^{(t)}$ 由学生熵 $H^{(t)}$ 与师生散度 $\Delta^{(t)}$ 归一化后 Soft-OR 合成。(4) GRPO 分支:二值奖励 $r_k=\mathbb{1}[a_k\equiv\hat{a}]$,全组 K 条算组相对优势使负样本 $A_k<0$;token 得分 $s^{(t)}=-\log p_\theta(y_k^{(t)})\cdot(1-\hat{H}^{(t)})$,取中位数以上为掩码 $m^{(t)}=\mathbb{1}[s^{(t)}\ge\mathrm{median}(s)]$;$\mathcal{L}_{GRPO}=-\frac{1}{|N|}\sum_{k\in N}A_k\sum_t m^{(t)}\log\pi_\theta(y_k^{(t)}|x,y_{<t})$。(5) 更新:$\theta\leftarrow\theta-\eta\nabla_\theta(\mathcal{L}_{OPSD}+\lambda\mathcal{L}_{GRPO})$,$\lambda=0.1$,LoRA r=64/α=128 全线性层,AdamW lr $5\times10^{-6}$,批大小 32,共 100 步。
技术新颖性
技术新颖性体现在四点。第一,路由机制的标签无关性:已有的蒸馏与 RL 混合工作(样本路由、辅助蒸馏损失、优势缩放等)都假设真实标签可用,TTPO 是首个在无标签 TTT 下把 OPSD 与 GRPO 按一致性路由的方法,且路由信号(是否属于多数簇)比伪标签内容本身更鲁棒。第二,失败模式的系统化定量:论文不只提出设计,还用消融把两种错误用法各自定价——FKL 用于负样本(43.9)与全量 FKL(46.3) quantify 了冲突项 $\Delta_{\text{conflict}}$ 的伤害,GRPO 用于正样本(37.2)量化了伪标签错误反转更新的风险,形成完整的设计空间地图。第三,双分支 token 级选择的首创组合:借鉴 TIP(蒸馏端按熵与散度选 token)与 STAPO(RL 端屏蔽低概率低熵 token)的洞察,但将'降权已收敛位置'与'只罚自信错误'统一进一个目标,消融显示两者互补(去掉后 AIME26 分别掉 3.2 与 1.1 点)。第四,自我进化机制的实证刻画:追踪训练中的 Avg@12 与 Maj@12,证明多数投票生成的监督会随模型提升而变好、二者互相抬升,最终超过用真实标签训练的 TTPO w/ GT(45.8 vs 更低),挑战了'更完美的标签必然更好'的直觉。
实验结果
核心结果分五块。(1) OpenThoughts 设定(Table 1):TTPO 不用任何标签即超过用真实标签的 OPSD——Qwen3-1.7B 五基准平均 40.1 vs 39.7(GRPO† 35.7、Base 34.6),4B 上 58.6 vs 58.4,8B 上 62.6 vs 61.7;TTPO-4B(58.6)已追平未训练的 8B(58.6)。(2) 纯 TTT 设定(Table 2):Qwen3-1.7B 从 38.0 升至 45.2,超 TTRL(40.2)5.0 点、超 OPSD-TTT(41.9)3.3 点;4B/8B 达 61.1/65.3,TTPO-4B 超过 8B 基线(60.7)。(3) 非思考评估(Table 7):TTPO 三尺度增益 +25.2/+30.6/+36.4(平均 34.7/50.5/56.7),远超 OPSD 的 +7.1/+5.8/+3.5,说明 RL 分支主动压制了学生自身生成模式中的失败路径。(4) 消融(Table 3/4/8/9/10):去掉正样本 token 权重 AIME26 从 46.5 掉到 43.3,去掉负样本掩码掉到 45.4;特权信息以'思考教师+短答案'最佳(46.5),完整轨迹降到 41.1;λ=0.1 最优(0.01 时 41.4);50/50 固定配比与最短轨迹选择均最佳。(5) 分析(Figure 4/5/6/7):单基准训练可迁移到另两个基准;真实标签替换伪标签反而更差(TTPO w/ GT 低于伪标签版 45.8),因难题上正样本近零使两支同时饿死(Eq.13-14);训练中 Maj@12 与 Avg@12 同步上升(至约 39.4 与 34.7),证明自我进化突破初始上限;TTPO w/ GT 损失几乎不降而 TTPO 持续下降。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 竞赛数学推理(OpenThoughts 训练,Qwen3-1.7B,AIME25/26+HMMT25/26+BRUMO25 五基准平均) | Avg@12(思考模式,温度1.0) | TTPO 40.1(不使用任何标签) | OPSD†(真实标签)39.7;GRPO†(真实标签)35.7;Base 34.6 | 较标签版 OPSD +0.4,较 Base +5.5,且全程无标签 |
| 纯 TTT 设定(Qwen3-1.7B,AIME26/HMMT26/BRUMO25 平均) | Avg@12 | TTPO 45.2 | OPSD-TTT 41.9;TTRL 40.2;Base 38.0 | 较最强无标签基线 OPSD-TTT +3.3,较 Base +7.2 |
| 纯 TTT 设定(Qwen3-4B / Qwen3-8B) | Avg@12 | TTPO 61.1 / 65.3 | Base 57.4 / 60.7;TTRL 58.8 / 63.0;OPSD-TTT 59.4 / 63.7 | TTPO-4B(61.1)超过未训练的 8B(60.7),无标签训练拉平模型规模差距 |
| 非思考模式评估(OpenThoughts,1.7B/4B/8B 平均) | Avg@12(思考关闭) | 34.7 / 50.5 / 56.7(较 Base +25.2 / +30.6 / +36.4) | OPSD† 16.6 / 25.7 / 23.8(较 Base 仅 +7.1 / +5.8 / +3.5);Base 9.5 / 19.9 / 20.3 | 增益为 OPSD 的约 3-10 倍 |
| 更新策略消融(Qwen3-1.7B,AIME26,TTT 设定) | Avg@12 | 完整 TTPO(pos=FKL, neg=GRPO)48.9 | 反向指派(pos=GRPO, neg=FKL)37.2;仅正样本 FKL 46.7;全量 FKL 46.3;TTRL 39.2;Base 37.8 | 非对称路由较反向指派高 11.7 点,验证设计方向正确 |
| token 级选择消融(Qwen3-1.7B,OpenThoughts,AIME26) | Avg@12 | TTPO 46.5 | w/o pos. weight 43.3;w/o neg. mask 45.4 | 两个 token 级机制分别贡献 +3.2 与 +1.1 点,且效果互补 |
局限与改进
作者承认的局限有三:一是依赖多数投票质量——当 K 很小或题目难得没有任何 rollout 答对时,投票信号退化,两个分支都会收到噪声监督,作者建议自适应正负配比或低共识时回退纯 RL;二是领域受限——实验只覆盖有可验证最终答案的数学推理,代码生成(需执行验证)与开放式推理(需学习型奖励模型)未探索;三是目标固定——整个训练过程用同一个非对称目标,随模型变强、伪标签变准,蒸馏与 RL 的最优配比可能漂移,值得引入动态课程。我自己的观察:第一,每题采样 K=64 条×16,000 token,再只取 8 条训练,采样与教师前向(思考模式输出更长)开销巨大,对大规模测试集成本可能不可接受;第二,方法对题目难度/通过率敏感——GT 路由在难题上饿死两支的发现反向说明当模型已能稳定答对时系统近似退化为 OPSD,收益上限受'思考→非思考蒸馏'约束;第三,答案等价聚类依赖可靠的数学等价判定(如 $\sqrt{397}$ 与小数表示),论文未详述实现,等价函数出错会分裂正确簇、直接污染伪标签与正负划分;第四,超参较多(λ、50/50 配比、top-50% 掩码、最短选择、JSD clip 按模型规模区分),最优点均来自单一模型族的消融,迁移到其他模型时可能需要重调;第五,在测试集上直接训练带来数据污染与分布漂移下的自强化风险,论文未讨论安全护栏。
独立分析的弱点
独立分析的弱点:(1) 采样与算力成本——TTT 在线采样 K=64×16,000 token,教师还需额外思考模式前向,训练用 4×H20 共 100 步;改进方向:用一致性早停减少 K、缓存教师前向、或蒸馏一个轻量投票器近似多数投票。(2) 对通过率区间的敏感性——伪标签错误率 85% 时仍有效依赖负样本惩罚的标签无关性,但当通过率升高后 GRPO 支优势趋零、系统退化为近 OPSD,非思考增益 +36.4 已接近饱和;改进方向:按共识度或实时通过率自适应调度 λ 与分支权重,让 RL 支在能力提升后转向更细粒度的失败定位。(3) 答案等价判定的隐藏脆弱——聚类用数学等价性,若输出格式不一致(分数/根式/小数),正确答案簇会被分裂导致伪标签与划分同时出错;改进方向:引入形式化验证器(SymPy 多表示归一化)或对等价置信度低的问题跳过训练。(4) 1,024 token 梯度窗口与'选最短轨迹'的偏差——关键推理常发生在链条后段,最短轨迹可能对应跳步或简单化的推理,选择策略引入分布偏移;改进方向:分段训练、关键 token 滑窗,或把梯度窗口外的 token 用压缩/摘要方式纳入监督。(5) 自强化的鲁棒性风险——模型在自身生成的数据上迭代训练,若早期伪标签错误被强化(correct-answer extinction 类失败),缺乏外部校准;改进方向:低共识回退机制、保留小规模验证集做早停、或对 Maj@12 停滞设置熔断。
未来方向
未来方向。作者明确提出的:(1) 低共识自适应——投票共识度低时调整正负配比或回退纯 RL,缓解极端难题下的信号退化;(2) 域扩展——把框架搬到代码生成(执行反馈天然可验证,与 TTPO 的奖励结构契合)与开放式推理(需学习型奖励模型替代答案等价判定);(3) 动态课程——随训练进程调整 RL 权重 λ 与正负比例。基于成果可延伸的:(4) 自进化理论化——Figure 6 显示 Maj@12 与 Avg@12 互相抬升,可建立'投票质量-模型能力'联合收敛的动力学模型,预测饱和点并指导何时停止训练;(5) 跨域伪标签——用语义聚类(嵌入相似度或 NLI)替代数学答案聚类,把非对称框架迁移到分类、信息抽取等可自动判等任务;(6) 训练-推理开销联合优化——TTPO 提升后的模型可用更少采样达到相同 Maj 水平,研究在给定算力预算下'多采样 vs 多训练'的最优分配;(7) 智能体与多模态场景——非对称惩罚天然适配动作序列中'定位错误动作'的问题,可结合作者团队此前的 TTRL-GUI、agentic RL 工作扩展到 GUI 操作与工具调用;(8) 理论深化——对 $\Delta_{\text{conflict}}$ 随训练的演化、token 掩码 top-50% 的偏差-方差权衡、以及 Soft-OR 权重的最优形式给出更严格的保证。
复现评估
复现评估:代码已开源(https://github.com/ZJU-REAL/TTPO),附录 A 给出完整配置(Table 5/6):LoRA r=64/α=128 作用于全部线性层,AdamW、bf16、Flash Attention 2,学习率 $5\times10^{-6}$,有效批大小 32,TTPO 训练 100 步(GRPO/TTRL 500 步),全词表 logit 蒸馏,教师固定为关闭 LoRA 的基础权重(学生关思考/教师开思考),采样温度 1.1、top-p 0.95、top-k 20,最大采样长度 16,000 token,梯度窗口 1,024 token,JSD clip τ 按 1.7B/4B=0.05、8B=0.06 区分;评估 Avg@12、温度 1.0、最长 38,912 token。算力方面 TTPO 用 4×H20(其余方法 8×H20),是复现的主要门槛,可尝试以 8×A100-80GB 等价替代但需重新验证吞吐。提示模板(附录 B)与 token 级选择可视化案例(附录 C)完整给出,数据(AIME/HMMT/BRUMO、OpenThoughts)均公开。总体复现难度中等偏上:主要不确定点是多数投票的'数学等价性'实现细节(论文未说明用什么工具判等,这直接影响伪标签质量)与教师提示模板的敏感性(Table 4 显示轨迹式特权信息会掉 5+ 点,措辞影响大)。建议路线:先在 Qwen3-1.7B + AIME26 单基准复现 TTT 训练曲线(对照 Figure 5 左的 45.8/42 级别),确认伪标签管线后再扩展全表。
论文图表
三联图:(a) 展示核心动机——伪标签为错时,与其不一致的 rollout 中约79%自己也是错的,且不一致 rollout 占比高达87%;(b) 给出 TTPO 概览:策略采样→多数投票→一致样本走 OPSD 蒸馏、不一致样本走 GRPO 惩罚;(c) 显示 Qwen3-1.7B 在三个竞赛基准上的平均准确率曲线,TTPO 领先 OPSD-TTT 与 TTRL。
这是全文的逻辑起点:三个统计数字(85% 伪标签错误率、79% 不一致样本确实错误、87% 不一致占比)构成非对称设计的实证地基,看懂这张图就理解了为什么'惩罚总是安全、蒸馏并非如此'。
比较 K_train=8 的正负构成策略:固定 50/50 最优(46.5/31.6/54.7),随机采样 45.8/30.3/50.9,动态跟随全组比例 46.1/31.1/51.1。
它澄清了一个微妙的设计取舍:动态配比在伪标签可信时应增加蒸馏、但会稀释负样本被放大的组相对优势,反向亦然;固定 50/50 保证两支每步都有稳定梯度贡献。
完整训练伪代码:五步循环——多数投票伪标签化并划分正负、教师(以伪标签为特权、no grad)与学生前向、对正样本计算 Soft-OR 加权的前向 KL、对负样本计算基于中位数掩码的组相对惩罚、按 $\theta\leftarrow\theta-\eta\nabla_\theta(\mathcal{L}_{OPSD}+\lambda\mathcal{L}_{GRPO})$ 更新。
它是方法的可执行规范,把正文所有公式(token 权重、掩码得分、统一目标)收拢为一页伪代码,是复现实现时对照代码库的首要入口。