← 返回 2026-08-31

获取、修复、保留:面向小模型对话博弈智能体的诊断引导式后训练配方 Acquire, Repair, Preserve: A Diagnosis-Guided Post-Training Recipe for Small-Model Dialogue Game Agents

Nan Li 📅 2026-08-28 👍 3 2026-09-01 18:30
DPO LoRA 偏好优化 后训练配方 对话博弈智能体 小模型 能力保留

广覆盖SFT获取参与,回合级DPO修复可验证错误,权重缩放保留通用能力

前置知识

监督微调(SFT)

用(提示,回复)成对数据直接最大化模型输出似然的训练方式。本文 Phase A 在 playpen-data 的成功对局上做 SFT,每游戏封顶 700 条、共 9,522 行,用 TRL SFTTrainer 配 LoRA 训练 1 个 epoch,让 2B 模型学会按协议参与全部 14 个 clembench 游戏,开发集 clemscore 从 13.05 升至 43.85,是整条管道中最大的单步收益。

Phase A 是'获取—修复—保留'配方的第一步,后续所有修复阶段都在它产出的父模型上继续训练,理解它才能理解各阶段贡献的来源。

直接偏好优化(DPO)

无需显式奖励模型的偏好学习算法:对同一提示下的偏好补全 $y^+$ 与被拒补全 $y^-$,以策略与冻结参考模型的对数几率差 $r_\theta$ 作为隐式奖励,最小化 $-\log\sigma(\beta(r_\theta(y^+)-r_\theta(y^-)))$。本文 Phase B/C 用它做回合级修复,$\beta$ 取 0.1–0.2,学习率 $5\times10^{-6}$。

理解 DPO 才能理解作者如何把程序化失败检测转化为偏好对,以及固定历史 $h$、腐构规则、$\beta$ 取值等设计选择为什么关键。

LoRA 与 delta scaling

LoRA 冻结基座权重、只训练低秩增量 $\Delta_{LoRA}=BA$。本文四个训练阶段都续用同一个 LoRA 适配器($r=16,\alpha=32$,全线性层);delta scaling 则把最终权重写成 $W(s)=W_{base}+s\,\Delta_{LoRA}$,免训练地扫描标量 $s$ 并在约束下选择工作点,最终 $s^\star=0.85$ 后做 fp32 合并。

delta scaling 是'保留'阶段的全部机制;'各阶段共享同一适配器'的设定也是管道能顺序叠加的前提。

clembench 与 clemscore

clembench 是对话博弈评测套件,程序化游戏主控跟踪状态并强制输出协议;clemscore 按 Eq. 1 聚合:每游戏先算完成率 Played(未被判定中止的对局百分比),再对已玩对局算任务分 Quality,两者在游戏间宏平均后相乘。官方评测含公共 502 集、闭域内 1,272 集、闭域外 360 集。

论文全部指标都建立在 Played×Quality 分解之上,理解它才能读懂'先修 Played 再修 Quality'这条贯穿全文的主线。

回合局部偏好对(turn-local preference pairs)

固定对话历史 $h$,被拒补全 $y^-$ 限定为'对干净成功响应施加一个确定性腐构'的产物——重复上一猜(repeat_last)、截取前四字符(bad_length)、替换为词库外五字母词(invalid_word)、追加重复 guess 行(duplicate_guess_keyword)——偏好补全 $y^+$ 是同一成功对局的原响应,使对比集中在反馈后少数决策 token 上。

这是本文最核心的方法创新,也是与整段对话 DPO(实测崩坏到 12.35 且破坏协议合规)的本质区别所在。

分支 DPO(branch-DPO)

让当前策略在同一游戏状态快照处分支采样(分支因子 2、轮次 1–3、$T=0.7$),按完整 episode 综合得分(结局、速度、接近度、策略及各类违规惩罚)给兄弟分支排名,取最高/最低分兄弟的即时分歧响应构成偏好对。Phase C 用 27 个 Wordle 实例产出 90 条轨迹、295 个分支点、77 对数据。

它是从'规则腐构负例'走向'模型自身残余错误'的桥梁,理解它才能评估 Phase C 边际贡献的争议。

研究动机

静态基准(MMLU 等)基本不考察模型在多轮交互中携带状态、解读反馈、并在不断累积的约束下选择合法动作的能力。对话博弈把这种依赖显式化:Wordle 中一次猜测会排除字母,猜词游戏中一条线索会约束队友动作,导航命令会改变后续命令的解释环境。LM Playschool Challenge 用 clembench 与 Playpen 环境考察这种能力,官方 Qwen3.5-2B 基线最终评测只拿到 10.67 clemscore,远低于同系 27B 模型的 60.30,说明小模型交互行为非常脆弱。作者逐条检查 2B 基线转录后发现,差距主要不是缺少游戏知识:模型常能保持预期输出格式,却在收到反馈后的某个局部决策上出错——重复被拒的猜测、猜出错误长度的词(如把五字母任务猜成六字母的 ringer)、编造词库外单词、重复 answer 字段。这类错误高频、可被规则机械检测、且定位于反馈后的单一决策点(表 1、表 7)。Playpen 提供的对话游戏反馈本身并不指出交互在何处停止前进,因此训练问题从'要不要重教整段对话'变成'监督应该放在轨迹的哪个位置'。

本文的目标是本文目标是为 2B 级小模型构造一个成本低、诊断驱动、且不牺牲通用能力的交互能力训练配方,并在官方最终评测中量化验证。具体而言:第一,通过广泛模仿让模型至少'参与'全部 14 个 clembench 游戏,解决大量对局因格式违规或中止而得 0 分的问题(基线公共对局完成率 Played 仅 27.22);第二,针对机械可验证的局部失败(重复猜测、错误长度、无效词、重复字段)做精准修复,提升已玩对局的条件质量 Quality;第三,把修复带来的专业化代价控制住,使聚合静态基准分 statscore 相对基线的 44.24 近似保持,最终公共 clemscore 大幅超过 10.67 的 2B 基线、闭域内分数越过官方 4B(34.02)与 9B(41.12)基线。整条管道须在单张 A100-80GB 上约 5.3 小时完成,保持小模型可复现、可部署的现实约束。

与已有工作不同的是,本文的独特切入是'诊断引导的监督放置'。与整段对话级偏好调优不同,作者把偏好对比锚定在收到反馈后的单个决策:固定对话历史 $h$,令被拒补全 $y^-$ 恰好含一个规则可判定的错误,偏好补全 $y^+$ 来自同一干净成功对局的有效替代动作,让 DPO 梯度集中在决定成败的少数决策 token 上;对照实验显示整段对话 DPO 仅得 12.35 并破坏多游戏协议合规,即便用强源模型过滤也只恢复到 25.76。第二个独特之处是把'保留通用能力'从数据层面难题(回放、混合)改写为权重空间模型选择问题:沿已学到的 LoRA 增量做标量缩放并做约束选择,零梯度即可平衡交互收益与静态分。第三个特点是罕见的方法论诚实:作者报告了两个因实现 bug 实际未更新权重的阶段、逐位相同权重三次评测 0.74 分的噪声带、以及后期阶段边际收益在两条评测轨上符号不一致的事实,把结论谨慎地定位为'轨迹'而非因果分解。

核心方法

直觉上,小模型的交互失败分两层:宏观的'无法按协议参与游戏'与微观的'参与后在某个决策点出错',需要不同干预。作者据此把配方组织为获取—修复—保留三步、四个训练阶段加一次免训练缩放,全部基于 Qwen3.5-2B 上的单个 LoRA 适配器($r=16,\alpha=32$,全线性)。Phase A 获取:在 playpen-data 成功对局上做 SFT(每游戏封顶 700 条、共 9,522 行,LR $2\times10^{-4}$,1 epoch),开发集 clemscore 从 13.05 升至 43.85。Phase B 修复:两轮回合级 DPO($\beta=0.1$,LR $5\times10^{-6}$),分别用 1,905 与 1,906 对修复重复猜测/错误长度与无效词/重复字段,得 46.83 与 45.52。Phase C 精修:分支 DPO,77 对自生成数据,$\beta=0.2$,到 48.52。Phase D 保留:免训练 delta scaling 选 $s^\star=0.85$,两评均值 50.43,fp32 合并提交。总成本约 5.3 小时(单张 A100-80GB)。

核心创新有二。其一,偏好信号应绑定在'机械可验证的反馈后决策'上。DPO 目标为 $$\mathcal{L}_{DPO}=-\mathbb{E}\left[\log\sigma\left(\beta\left(r_\theta(h,y^+)-r_\theta(h,y^-)\right)\right)\right],\quad r_\theta(h,y)=\log\frac{\pi_\theta(y|h)}{\pi_{ref}(y|h)}$$ 关键在固定 $h$:负例不是另一次完整失败对局,而是对同一干净成功响应施加确定性腐构(repeat_last、bad_length、invalid_word、duplicate_guess_keyword),使对比只落在判断是否违规的少量 token 上,并枚举全部合格反馈后回合逐点合成负例,绕开昂贵的失败定位。其二,把保留视为模型选择而非监督问题:$W(s)=W_{base}+s\,\Delta_{LoRA}$,按 $s^\star=\arg\max_s S(W(s))\ \text{s.t.}\ C(W(s))\ge C_{min}$ 选标量($s^\star=0.85$),在交互收益与静态分之间选工作点,免训练且可组合到任意朴素 LoRA。这与主流'加数据防遗忘'思路本质不同。

方法步骤详情

步骤零(诊断):Phase A 后原始 Wordle 质量仍为 0,转录显示模型重复猜测并违反即时反馈,这些失败高频、局部、机械可检,故选定 Wordle 为修复目标(后续只用 Wordle 数据,评测仍是全部 14 游戏)。步骤一(获取):输入 playpen-data 训练集成功对局,按游戏封顶 700 条、95/5 切分,SFT 训练 LoRA(13.05→43.85)。步骤二(修复第一轮):从干净成功 Wordle 对局枚举合格的反馈后回合,施加 repeat_last 与 bad_length 腐构得 1,905 对,DPO 后重复循环消失。步骤三(修复第二轮):新暴露的无效词与重复字段用 invalid_word 与 duplicate_guess_keyword 再修 1,906 对。步骤四(分支 DPO):载入 27 个 Wordle 实例,当前检查点分支采样(因子 2、轮次 1–3、$T=0.7$),以完整 episode 综合得分排序兄弟分支,取最高/最低分者的即时分歧响应构成 77 对($\beta=0.2$)。步骤五(保留):lora_B 逐元素乘 0.85,约束下扫 $s$ 后 fp32 合并。

技术新颖性

单点算法(SFT、DPO、LoRA、模型合并)均为现成技术,新颖性在于监督放置与保留机制的系统性论证与实证检验。第一,把'哪段轨迹该被监督'形式化为回合局部对比:用四条确定性腐构规则把失败检测变成程序可判定的谓词,产生管道中最清晰的正信号——turn-DPO 第一轮是唯一在提交模型轨迹(+2.98)与受控单主机消融(+1.49)两条评测轨上同时为正的后期阶段,而整段对话 DPO 得 12.35 并破坏 Wordle、Codenames 等游戏的协议合规,形成尖锐对照。第二,delta scaling 把灾难性遗忘的缓解转化为单标量约束优化,免训练、可组合,为'专业化税'提供极轻量的处理方式。第三,方法论透明度本身即贡献:作者披露两个名义阶段因适配器以推理模式加载(输出适配器 372/372 张量逐位相等)与 GRPO 参考模型 bug(KL 恒为零、所有梯度被丢弃)而根本未改变权重,并用逐位相同权重三次评测 43.85/44.09/43.35 的 0.74 分散布,为 67 集小样本交互评测给出噪声基线。

实验结果

官方最终评测:公共 clemscore 从 10.67 升至 38.92(+28.25),闭域内从 13.41 升至 41.17(+27.76),静态分 44.14 对基线 44.24 近似保持;公共分超过官方 4B(26.66)与 9B(31.91)基线,但闭域外仅 7.88,且 OOD Played 从 35.19 降到 33.08、低于未训练基线,OOD 收益完全来自已玩对局的质量提升(10.56→23.81)。开发集轨迹:13.05→43.85(A)→46.83/45.52(B)→48.52(C)→50.43(delta scaling 均值)。受控消融(表 8)显示只有 turn-DPO 第一轮在两轨同正(+2.98/+1.49),第二轮(−1.31/+1.34)与分支 DPO(+3.00/−2.07)符号不一致。隐域内最大收益出现在从未针对的游戏——TMW GraphReasoning +70.99、ImageGame +60.05、AdventureGame +58.33,而目标 Wordle 家族仍近零;域外正移动 84.86 中 70.02(82.5%)来自三个 Wordle-crazy 配置。静态重分布:BBH 0.00→30.47,IFEval 68.52→51.85,EQ-Bench 64.78→56.43。选点后继续训练的十个端点全部低于 50.43(44.15–48.92);公共分与隐域内相关 $r=0.93$,与隐域外仅 $r=0.30$。

Simplified Wordle failure states
Table 1: Simplified Wordle failure states
Pipeline trajectory on the pinned public-development set
Table 2: Pipeline trajectory on the pinned public-development set
Official final evaluation results of the LM Playschool Challenge
Table 3: Official final evaluation results of the LM Playschool Challenge
Played and Quality decomposition of the official final evaluation
Table 4: Played and Quality decomposition of the official final evaluation
Complete training configuration for the four effective phases
Table 5: Complete training configuration for the four effective phases
Broad-SFT per-game counts at the reconstructed training-time snapshot
Table 6: Broad-SFT per-game counts at the reconstructed training-time snapshot
A real Wordle failure from the broad-SFT checkpoint
Table 7: A real Wordle failure from the broad-SFT checkpoint
Controlled single-host ablation
Table 8: Controlled single-host ablation
Ten evaluated late-continuation endpoints
Table 9: Ten evaluated late-continuation endpoints
Public static components of the official evaluation
Table 10: Public static components of the official evaluation
Official hidden in-domain per-game decomposition
Table 11: Official hidden in-domain per-game decomposition
Official hidden out-of-domain per-game decomposition
Table 12: Official hidden out-of-domain per-game decomposition
Matched per-game comparison of four checkpoints on the pinned public-development set
Table 13: Matched per-game comparison of four checkpoints on the pinned public-development set
Plain-Wordle behavior after each phase on the three public validation episodes
Table 14: Plain-Wordle behavior after each phase on the three public validation episodes
查看结构化数据
任务指标本文基线提升
公共交互套件(clembench 游戏 + 静态基准,502 集) Clemscore 38.92 10.67(Qwen3.5-2B 基线) +28.25;超过官方 4B(26.66)与 9B(31.91)基线
闭域内隐藏交互套件(1,272 集) Clemscore 41.17 13.41(Qwen3.5-2B 基线) +27.76,略超官方 9B 基线(41.12)
闭域外隐藏套件(360 集,8 个未见游戏家族) Clemscore 7.88 3.72(Qwen3.5-2B 基线) +4.16,但 Played 35.19→33.08 低于基线,迁移仅限 Wordle 变体
聚合静态基准(BBH/CLadder/EQ-Bench/IFEval/MMLU-Pro) Statscore 44.14 44.24(Qwen3.5-2B 基线) −0.10,近似保持(组件重分布:BBH +30.47,IFEval −16.67,EQ-Bench −8.35)
pinned 公共开发集(67 集,14 游戏)管道端点 Clemscore 50.43(delta scaling s=0.85 两评均值) 13.05(同轨 Qwen3.5-2B 基线) +37.38;其中广 SFT 贡献 +30.80,Wordle 专项阶段 +4.67,缩放+合并 +0.18

局限与改进

作者承认的局限:机械可验证修复只覆盖 Wordle 家族(Phase B/C 只构造 Wordle 偏好数据),未测试需要语义或策略判断的失败;未变化获取阶段父模型的强度与覆盖,无法判断回合局部修复对更强模仿基座是互补还是冗余;顺序轨迹叠加重复选择与评测噪声,不构成各阶段的因果分解,67 集公共开发集上后期阶段边际甚至在两轨间符号不一致;delta scaling 的保留目标是聚合的,组件层面是重新分配而非逐项保持(IFEval −16.67、EQ-Bench −8.35 被 BBH +30.47 抵消);只验证 Qwen3.5-2B 单一规模。我自己的观察:OOD Played 低于基线意味着模型在陌生游戏家族中更容易中止对局,7.88 的绝对水平仍很低,'82.5% 域外收益来自 Wordle 变体'说明所谓迁移只是近邻泛化;所有管道决策都基于与官方评测不同的 67 集开发轨,存在选择偏差风险;同基座的 DAIR 纯 SFT 系统(公共 46.01、闭域外 15.62)在 OOD 上明显更好,进一步质疑后期修复阶段的净价值。

独立分析的弱点

弱点一:修复目标面过窄。四条腐构规则全部针对 Wordle 的表面协议违规,无法处理线索推理错误、策略不当等语义层失败,Codenames 等游戏的类似失败模式无从覆盖;改进方向是为各游戏建立可判定违规谓词库,或训练失败检测器并用程序验证做弱监督,把回合局部对比推广为通用模式。弱点二:后期阶段边际小且不稳定。SFT→分支 DPO 仅 +4.67,第二轮与分支 DPO 在两轨符号相反,而同基座 DAIR 纯 SFT 即达 46.01 公共分,修复阶段的必要性存疑;改进方向是扩大每类偏好对数量、跨游戏并行修复、多种子重复实验并报告置信区间。弱点三:聚合式保留掩盖组件崩塌,IFEval 从 68.52 跌至 51.85 会真实伤害指令遵循能力;改进方向是在模型选择中加入组件级下限或多目标帕累托准则,而非只最大化聚合 statscore。弱点四:评测噪声与选择偏差。逐位相同权重三次评测相差 0.74 分,所有决策又基于每游戏仅 3–13 集的 67 集开发轨;改进方向是扩充开发集、预注册选择规则,并对 delta scaling 的 $s$ 扫描做敏感性分析。

未来方向

作者提出的方向:把诊断从机械违规扩展到语义与策略判断失败;寻找能触及 Wordle 家族与公共开发分布之外的诊断或选择信号以改善闭域外表现(公共分与隐域外仅 $r=0.30$);变化获取阶段配方以界定回合局部修复的适用域;在更大规模基座上检验可扩展性。基于成果可延伸的方向:一是把'固定历史、token 级对比'范式移植到通用智能体轨迹(工具调用、代码执行反馈后的单步决策),凡存在程序化验证器的环境都可复用腐构式负例合成;二是把 delta scaling 与任务向量、模型合并文献结合,做多轴(交互/静态/安全)权重空间选择;三是恢复被移除的在线方法——附录 A.4 修复 bug 后的 GRPO 已有 +1.48 的初步正信号,可与回合局部可验证奖励结合做在线 RL;四是研究 Played/Quality 分解视角下的训练动态,特别是 OOD Played 低于基线的机理(模型是否学会'宁可不玩'),以指导探索与合规之间的平衡;五是按 Played→Quality 两阶段设计课程,把 DAIR 式强获取与本文式精修复结合起来。

复现评估

复现条件较好。数据:playpen-data 公开在 HuggingFace(colab-potsdam/playpen-data),开发评测钉住数据修订 557d8caf 与 clembench 提交 ed39486;官方结果仓库 lm-playpen/lm-playschool-2026-final-results 公开(快照 2dd5a533);提交模型 chnln/Qwen3.5-2B-playpen-playornotplay(修订 828e356)可直接下载。算力:全部训练约 5.3 小时单张 A100-80GB,LoRA 全线性 $r=16$、bf16,附录表 5 给出完整超参(LR、warmup、长度、$\beta$、腐构规则、分支采样协议)。工具:Playpen 训练器基于 transformers/peft/trl。难度中等偏易:主要障碍是搭建 Playpen/clembench 评测环境、闭域测试集只能依赖官方评测、以及小样本噪声(作者同权重三次评测差 0.74 分,复现者应多次评测取均值);若管道代码未放出,需按附录 A.3 自行实现数据构造。