← 返回 2026-08-04

Wnuan:面向专有企业知识问答的分阶段后训练 Wnuan: Staged Post-Training for Question Answering over Proprietary Enterprise Knowledge

Xiaofeng Shi, Xiaosong Qiu, Wenxin Ma, Qian Kou, Yiming Pan, Longbin Yu, Ying Liu, Haiping Wang, Hua Zhou 📅 2026-08-03 👍 6 2026-08-09 18:30
GRPO强化学习 企业知识问答 后训练 残差数据选择 闭卷问答 领域适应

三阶段后训练流水线把企业问答可接受率从52.76%提升到91.51%。

前置知识

监督微调(SFT)与全参数训练

在带标签的指令-回答数据对上对预训练模型参数做梯度更新,使其学会按特定风格与格式回答。本文对Qwen3-32B做全参数bf16训练,混入领域QA与通用回放数据。

论文Stage II的核心机制,理解它才能理解为何需要通用数据回放来缓解灾难性遗忘。

GRPO(Group Relative Policy Optimization)

PPO的简化变体,不训练独立的价值网络,而是对同一prompt采样的多个响应(本文5个)的奖励做组内标准化(减均值除标准差)得到优势函数,再优化带裁剪的PPO式目标。

Stage III的优化算法基础,理解残差错误采样为何能集中在难样本上发挥增益。

经验回放(Replay)与灾难性遗忘

在领域微调时混入一定比例的通用数据,防止模型为学新知识而遗忘原有通用能力。本文测了0%–100%五个回放档位,选出48.3%的操作点。

论文Stage II的关键权衡,决定了领域精度与通用能力之间的操作点。

任务导向语料适应

把原始文档改写成模型可学的监督信号,如AdaptLLM的阅读理解改写、KEFT、DS2-Instruct。本文用六种任务形式(事实抽取、机理说明等)把企业文档转成自包含QA。

Stage I的方法根基,理解文档如何被转成QA监督是读懂整条流水线的前提。

可接受回答率(AAR)与LLM评判集成

AAR把判为正确和部分正确的回答都算合格(区别于严格全对率)。本文用gpt-oss-120b、MiniMax-M2.5双主判+DeepSeek-V3.2裁决的三模型集成打0/0.5/1分。

这是论文唯一的主指标,且其与领域专家90.5%的一致率是所有结论可信度的基石。

研究动机

企业问答系统依赖内部政策、技术标准和操作规程,这些内容通常不在公开预训练语料中。通用大模型(如Qwen3-32B基座)在闭卷测试中只能答对约52.76%的企业问题。把通用模型适配到这种场景面临三重挑战:第一,必须让模型学到专有知识;第二,不能丢失通用的指令遵循能力;第三,后训练预算有限,必须高效使用。以往工作分别处理这些问题:任务导向语料适应(AdaptLLM的阅读理解改写、KEFT、DS2-Instruct)把文档转成可学习的监督信号;但后训练可能改变泛化与指令遵循能力(Kirk等2024;Lin等2024);RLHF中混入预训练数据更新可减少公开基准回归(Ouyang等2022);检索增强生成(RAG)在推理时提供证据;数据选择方法(LESS的影响力估计、DAPO的零优势过滤、难度感知对齐)在微调前挑样本或在RL时过滤无信息组。但很少有人研究这些选择在单一企业QA流水线中如何交互,尤其当SFT已经纠正了大部分简单样本之后。Table 1显示,即便是表现最好的外部API(GPT-5.4)在闭卷WnuanBench上也只有67.75%的可接受回答率,远不能满足企业生产需求。

本文的目标是本文的目标是构建一条端到端的后训练流水线,把专有企业文档转化为一个闭卷的企业QA模型,同时尽可能保留通用能力,并在有限预算内高效训练。具体地,作者希望:(1)把企业文档自动转成自包含、任务导向的QA监督信号;(2)通过带通用数据回放的SFT,找到一个领域精度与通用能力之间的操作点;(3)在SFT之后,对模型仍然答错的残差错误施加GRPO强化学习,集中有限的更新预算;(4)建立一套专有的评测基准WnuanBench(707题,覆盖8个业务领域),用多模型评判集成来评估闭卷回答质量,并与领域专家标注校准。最终目标是用一个32B参数的模型,在闭卷企业问答上达到接近90%的可接受回答率,并清晰量化每一阶段的收益与代价,既报告增益也报告指令遵循的损失。

与已有工作不同的是,本文的独特切入角度是残差错误采样——在SFT已经解决大部分简单样本后,不去做复杂的数据选择算法(如LESS的梯度影响力估计、DAPO的零优势组过滤、难度感知对齐的样本是否超出模型容量判别),而是采取一个更简单的食谱选择:直接挑出SFT后仍判为错误的56,147个样本,与全池(230,183行)和等规模随机(56,147行)在统一的100更新协议下做严格受控对比。这与以往挑选有影响力样本或过滤难样本的思路不同,它是把固定预算完全集中在当前错误上。此外,作者明确把检索与生成解耦——只训练一个闭卷生成器,把RAG当作推理时的独立干预单独评测,而非训练一个检索感知的生成器。论文还诚实地量化领域增益伴随的指令遵循代价(通用基准降5.17点、IFEval降6.52点),这是很多领域适应论文刻意回避的部分。

核心方法

整体思路是分阶段喂料加纠错:先让模型读熟企业文档(转成问答),再用回放保住常识,最后专门补课它还答错的部分,三阶段各有明确分工。Stage I(文档转QA)把OCR归一化后的文档按语义和段落边界切分,抽取命名锚点、生成自包含问题(事实抽取、机理说明、设计理由、条件约束、局限或权衡、比较六种任务形式),生成答案后用规则、指代、可答性、忠实性、质量多重过滤,再经目标对齐改写(仅当MiniLM余弦$\geq 0.8$且通过格式过滤才替换原答案)。Stage II(带回放的SFT)在Wnuan-Base(Qwen3-32B)上做全参数bf16 SFT,混入221,294领域+106,950通用样本(实际48.3%,标称50%)加小量辅助样本,共341,420例。Stage III(残差错误GRPO)在230,183行选择池上用三模型评判找出Wnuan-Inst仍答错的56,147例做强化学习。简言之:Stage I组织知识,Stage II选保留操作点,Stage III集中预算纠错。

核心创新是Stage III的残差错误RL。本质区别在于:大多数RL数据选择工作要么从全池采样(DAPO),要么按难度或影响力排序(LESS用梯度影响力、难度感知对齐用样本是否超出模型容量判别),要么在线过滤零优势组。Wnuan做一个更简单的受控选择——把固定预算完全集中在SFT后仍判错误的样本上,并设计了一个等规模随机组和一个全池组做严格对照。结果是在统一100更新协议下,残差组达89.39% AAR,分别比全池(86.28%)和等规模随机(86.42%)高3.11和2.97个百分点(Holm校正后$p=0.035$),且源聚类bootstrap区间都为正(残差−全池 0.83–5.70、残差−随机 0.81–5.08)。第二个关键点是目标对齐改写:用目标模型自身把答案改写成它偏好的风格,再设相似度门控,目的是减少训练时的分布不匹配——虽然Stage I实验没看到独立的AAR增益,但它恢复了2.94个点的通用基准平均分。论文核心命题是:SFT解决易例后,把固定预算压在残差错误上是有效的数据策略。

方法步骤详情

Stage I:把5,648源路径的企业文档经DataRater质量过滤、Qwen3-14B语义切分、Qwen3-32B按六种任务形式生成自包含问题、DeepSeek-V3.2生成答案、多重规则与忠实性质量过滤、目标对齐改写(仅当余弦$\geq 0.8$且过格式门才替换)后,输出221,294条SFT样本。Stage II:在Wnuan-Base(Qwen3-32B)上做全参数bf16 SFT,341,420例,AdamW,3轮11,976更新,峰值学习率$\eta=10^{-5}$余弦衰减,输出Wnuan-Inst。Stage III:在230,183行池上判错得56,147残差样本做GRPO,每prompt采5响应,奖励 $r=0.6r_{acc}+0.3r_{quality}+0.1r_{format}$($r_{quality}$为逻辑/专业/简洁三项均值,Qwen3.5-35B评分),组内标准化优势,裁剪$\epsilon=0.2$、参考惩罚$\beta=10^{-2}$,学习率$10^{-6}$,3轮到更新327,输出Wnuan-RL。

技术新颖性

技术新颖性体现在几个方面。首先是受控的残差错误对比实验设计:三条臂(残差/全池/等规模随机)共享Wnuan-Inst初始化、prompt、评分流程、rollout数、优化器与100更新日程,只隔离数据选择这一个变量,这是比单纯报告主结果更强的因果证据。其次,作者做了源聚类bootstrap(对217个源文档重采样、保留每文档全部问题)来量化文档级相关性,比仅做题目级bootstrap更稳健。第三,目标对齐改写虽非新方法,但用相似度门控+格式过滤的双门设计、以及事后做的固定预测审计(重判107,432条改写目标,验证错误集成员资格91.69%稳定、错误率仅变−0.86点)来检验参考目标敏感性,是严谨的做法。第四,引入AAR(合并完全正确+部分正确)作为主指标,并专门做了与一位权威领域专家的校准研究(147条,一致率90.5%,$\kappa=0.796$)。第五,明确把检索与生成解耦,用固定BM25+BGE-M3 top-5检索对三个checkpoint做train-free诊断,揭示RAG在SFT/RL后非可加。这些都是工程与科学兼顾的设计。

Wnuan training path, primary 32B results, contextual systems, and WnuanBench construction.
Figure 1: Wnuan training path, primary 32B results, contextual systems, and WnuanBench construction.
Design studies preceding Stage III.
Figure 4: Design studies preceding Stage III.

实验结果

端到端:Wnuan-Base(Qwen3-32B)AAR仅52.76%;SFT提升到80.06%(+27.30点,$p<0.001$);GRPO再升到91.51%(+11.45点,$p<0.001$)。SFT贡献大部分增益,RL主要贡献非幻觉(幻觉率65.91%→15.70%),质量维度全面改善:正确率40.31→78.43%、完整度36.00→66.76%、忠实度30.20→72.14%。代价是通用均分88.61%→83.44%(−5.17点),集中在IFEval(Inst→RL降6.52点),MMLU/C-Eval略升。残差采样受控实验:残差89.39% > 随机86.42% > 全池86.28%,残差比全池+3.11、比随机+2.97点(校正$p=0.035$)。外部对比:最强GPT-5.4仅67.75%,Wnuan-RL高出近24点;671B的Wnuan-Plus-Inst达81.19%。Stage I文档转QA比固定窗口训练高31.12点。RAG诊断对基座+20.22点但对RL −9.76点,专业化后非可加。

Closed-book WnuanBench results (%).
Table 1: Closed-book WnuanBench results (%).
General-data replay grid (%).
Table 11: General-data replay grid (%).
Controlled answer-only GRPO endpoints at update 100 (%).
Table 13: Controlled answer-only GRPO endpoints at update 100 (%).
Question- and source-cluster bootstrap sensitivity on WnuanBench (AAR percentage points).
Table 17: Question- and source-cluster bootstrap sensitivity on WnuanBench (AAR percentage points).
Core evidence.
Figure 2: Core evidence.
Online validation accuracy-reward trajectory for the main Wnuan-RL run.
Figure 3: Online validation accuracy-reward trajectory for the main Wnuan-RL run.
查看结构化数据
任务指标本文基线提升
企业知识闭卷问答(WnuanBench,707题) 可接受回答率 AAR (%) Wnuan-RL: 91.51% Wnuan-Base (Qwen3-32B): 52.76% SFT +27.30点 → RL再 +11.45点,端到端 +38.75点(p<0.001)
企业知识闭卷问答(WnuanBench) 可接受回答率 AAR (%) Wnuan-RL: 91.51% 最强外部API GPT-5.4: 67.75% +23.76点,显著超过所有外部API(GLM-5.1/Kimi K2.6/DeepSeek-V4-Pro等)
残差数据选择受控实验(统一100更新GRPO) AAR (%) 残差错误采样: 89.39% 等规模随机: 86.42%;全池: 86.28% 比随机 +2.97点、比全池 +3.11点(Holm校正 p=0.035,源聚类区间均为正)
Stage I文档转QA vs 固定窗口训练 AAR (%) 文档转QA: 83.45% 固定窗口文本: 52.33% +31.12点(多用27.8% FLOPs,McNemar p<0.001)
通用能力保留(MMLU+IFEval+C-Eval均值) 通用基准平均 (%) Wnuan-RL: 83.44% Wnuan-Base: 88.61% −5.17点(代价),主要集中在IFEval(Inst→RL −6.52点),MMLU/C-Eval略升

局限与改进

作者明确承认的局限:(1)评测范围只覆盖一个企业、一套同域验证和基准,WnuanBench与训练QA记录不相交但共享同一授权源语料,没有源外/时间/跨企业/开放世界划分,所以测的是对已代表知识库的掌握而非迁移;(2)训练证据层面,Stage I是不等预算配置研究,残差/全池/随机虽共享100更新协议,但91.51%主端点和89.39%受控端点在响应格式、batch、序列长度、硬件、日程上都不同,归因仅限于三条完成的采样臂,未测基于不确定性/损失/影响力/在线零优势的选择器;(3)检索诊断只用一条检索管线,无gold Recall@5标签,no-RAG生成用的是历史不同种子;(4)评测校准只依赖一位领域专家。我自己的观察:AAR把部分正确也算可接受,会高估真实可用性;样本量小(仅56,147残差、707题),源聚类区间虽为正但偏宽(残差−全池源聚类区间0.83–5.70);RL的IFEval代价未被有效缓解,且第二次回归感知续训(RL-2)失败(幻觉15.70%→20.93%、IFEval 80%→76%)说明简单继续RL并不自动有益。

独立分析的弱点

弱点一:IFEval指令遵循随RL显著下降(−6.52点),作者尝试的回归感知续训RL-2反而把幻觉从15.70%升到20.93%、IFEval从80%降到76%,说明需显式指令回放或改进的事实一致性奖励,而非盲目续训——改进方向是在Stage III奖励中加指令遵循项,或在残差池混入通用指令样本。弱点二:检索与生成解耦导致专业化后RAG负可加(RL阶段−9.76点),应训练检索感知生成器或加置信度门控而非无条件拼接——可学一个检索置信度门控,或用RAFT式训练让模型学会忽略干扰。弱点三:只测一个企业,跨企业迁移能力未知,AAR在源外文档上是否仍>90%存疑——应构造源外/时间外划分验证。弱点四:评测只一位专家、幻觉检测F1仅0.748(召回0.657偏低),可增加多专家交叉标注。弱点五:AAR把部分正确算合格,掩盖原子数字、日期、责任部门等精确性短板——应引入精确匹配子指标做细粒度诊断。

未来方向

作者明确提出的未来方向:改进指令遵循的保留,以及在迁移导向和检索感知设置下测试整个流水线。基于成果可延伸的方向:(1)把检索置信度门控做成可学习模块,结合BM25/BGE-M3分数动态决定是否拼接,解决RL阶段RAG负可加问题;(2)在Stage III的语义奖励里引入事实一致性惩罚(如对数字、日期、部门名、文档名做实体级匹配),专门针对残留失败类别(精确数字、日期、文档名、闭集枚举、遗漏条件);(3)扩大残差选择器族——测LESS式梯度影响力、不确定性/损失排序、在线零优势过滤,与残差采样做更大规模对照;(4)构造跨企业/源外划分,检验AAR的迁移泛化能力;(5)把WnuanBench扩展为多专家标注+互斥错误类别标签,支撑细粒度误差分析;(6)探索混合架构——闭卷Wnuan-RL做主力,RAG做高置信补充,用门控融合,而不是二者择一。

复现评估

复现评估:专有源文档和完整WnuanBench因企业材料管理约束不能发布,是最大障碍。但作者发布Code and Data Supplement:含正确性评判prompt(correctness_judge_prompt.txt,含0/0.5/1细则和JSON契约)、虚构合成评测fixture、参考脚本reference_statistics.py(可复现AAR、配对bootstrap、精确McNemar)及analyze_source_cluster_bootstrap.py等只读标量W&B键的脚本。训练配置详尽:SFT用Qwen3-32B全参数bf16、DeepSpeed ZeRO-3、4节点×8加速器、341,420例、11,976更新;GRPO用2节点×8 H100-80GB、全局批128,算力需求较高。难度中等偏高:涉及多个本地部署模型(生成、改写、评判各环节不同),且改写、残差选择、三模型评判链路长。数据治理强调全程本地处理、最小化、去标识,未用外部API训练。总体属方法可复现、企业数据不可复现的典型工业研究。