Industrial-Instruction:从工业技术报告端到端构建指令微调与基准数据集 Industrial-Instruction: An End-to-End Framework for Building Instruction-Tuning and Benchmark Datasets from Industrial Technical Reports
用OCR抽取加五场景RAG问答合成流水线,把906份松下工业文档变成13.6k条微调与评测数据。
前置知识
RAG(检索增强生成)
检索增强生成在回答问题前,先用用户查询从外部知识库检索相关文档,再把文档塞进提示词让大模型基于证据作答,从而把'参数内记忆'换成'可随时更新的外部知识'。本文用最简版 RAG 索引松下工业文档:EmbeddingGemma 做嵌入、FAISS 做向量检索。
本文的数据合成完全建立在 RAG 检索结果之上,五种训练场景直接刻画'查询-文档'关系,不理解 RAG 就无法理解数据是如何被构造出来的。
指令微调(Instruction Tuning)
在预训练模型上用'指令-回答'样本对继续训练,使模型学会遵循用户指令并适配目标任务格式。与继续预训练不同,它主要改变行为对齐而非注入新知识,本文对 Qwen3-4B 的全参微调即属此类。
论文的核心产出就是指令微调数据集,实验部分'LoRA 无效、全参微调有效'的整条对比线都围绕指令微调展开。
LoRA 与全参微调
LoRA 是参数高效微调方法:冻结原权重,只训练低秩增量 $\Delta W = BA$(秩 $r \ll d$),大幅节省显存;全参微调则更新全部权重。LoRA 省资源但学习全新知识的能力弱,尤其需要深度逻辑推理时性能低于全参微调。
论文先尝试 R8–R64 四种 LoRA 秩配置全部失败(指标几乎不动),随后转向全参微调才获得 13.5–15 点提升,理解二者差异才能读懂这条关键实验线。
灾难性遗忘与 MMLU
模型在窄域数据上微调后会丢失部分预训练获得的通用能力,称为灾难性遗忘。标准测量协议是用 MMLU(57 个学科、14,042 道多选题、分 4 大类)在微调前后各测一次总体准确率,量化通用知识的损失程度。
论文用 MMLU 对比两版数据微调后的遗忘差异(-1.26 vs -0.05 点),这是'开源 vs 闭源生成器'结论中'通用知识保持'维度的全部证据。
布局感知文档解析(VLM-OCR)
PDF 格式只存储字符摆放指令而非语义结构,规则抽取会把表格压平、打乱阅读顺序。布局感知方法用视觉-语言模型(如本文的 Dots.OCR,3B 参数)同时识别区域类型、恢复阅读顺序,并输出 Markdown 与结构化 JSON,保留表格与正文之间的结构关系。
表格密集是工业文档的显著特征(291 页抽取失败中 236 页因表格而起),抽取质量直接决定下游合成数据的可信度。
多标签集合评测指标
当答案是选项集合(如 [A,B])时,Exact-Match 会因顺序差异误判。集合匹配准确率先把预测与真值转为无序集合再判等;$F_1 = \frac{2PR}{P+R}$ 平衡精确率与召回率;Jaccard $\frac{|A \cap B|}{|A \cup B|}$ 度量集合重叠。
松下基准的三个指标全部基于集合语义,且模型输出要先经过正则化层抽出 JSON 答案块才能计算,读懂指标才能读懂所有结果表。
研究动机
工业技术报告(维护手册、产品目录、故障分析报告)沉淀了数十年专家知识,是状态检修和 FMEA 等 Industry 4.0 应用的知识基础,但其结构高度异构:叙述性正文、参数表格、图表混杂,同一主题的知识散落在不同章节与格式中。表格占比尤其可观——在 ICT 类数据集中表格文字约占总词数的 18%,一个 6GB 数据集中表格就含 1.78 亿词,传统信息检索虽能召回相关片段,却难以抽取跨段落、跨表格的复杂关系。数据侧的缺口更致命:此前没有任何公开的、由真实工业技术报告构建的指令微调或基准数据集。模型侧的证据同样严峻:GPT-4、Llama 等前沿模型在 FailureSensorIQ 工业基准上平均准确率仅 53.5%,问题措辞被扰动后可跌至 12%;在 HotpotQA 等通用数据集上微调的开源模型转到工业基准平均只有 29%,说明通用数据完全无法覆盖工业推理需求,而现有研究又几乎都聚焦超大模型,忽视更适合企业本地部署的 100 亿参数以下小模型。
本文的目标是本文的目标是补齐'数据'这块短板:构建一套可复现的端到端流水线,把公开的工业 PDF 技术报告自动转化为高质量指令微调数据与配套基准,专门服务于 100 亿参数以下的小模型(这类模型算力需求低,适合中小企业和研究团队本地部署)。具体产出有三:(1) 基于 906 份公开的松下(Panasonic)文档、共 7,525 页构建的 'Panasonic Dataset',含约 13.6k 条五选项多选题式 QA 对,附带检索来源文档与 1,000 题的预留基准测试集;(2) 完整开源数据生成流水线与评测脚本;(3) 用同一流水线分别以开源 Qwen3-30B-A3B-Instruct 和闭源 API 模型 Claude-Opus-4.6 生成两个平行版本数据集,使'开源与前沿模型谁是更好的数据生成器'可以在数据质量、下游微调增益、货币成本和通用知识保持四个维度上被直接量化比较。
与已有工作不同的是,本文的独特切入角度有三层。其一,现有工业大模型研究要么只做评测(如 FailureSensorIQ 用 ISO 文档自动构造 8,296 道选择题,只测不训),要么聚焦 ChatGPT 级超大模型,作者则瞄准'真实厂商技术文档到可训练数据'这条此前无人走通的路径,并明确以 <10B 小模型为服务对象。其二,作者把多场景检索增强生成范式迁移到异构工业 PDF 上:不是朴素的'拿文档生成问答',而是显式建模检索系统在真实世界中遇到的五种查询-文档关系(无关召回、单/多文档线索、单/多文档答案),让训练数据自带'抗检索噪声'与'多步证据整合'两种信号。其三,同一流水线、同一提示词、同一过滤规则下只更换生成模型(开源 Qwen3-30B-A3B-Instruct vs 闭源 Claude-Opus-4.6),把工程界天天面对却缺少受控证据的'合成数据该用哪个模型生成'问题,变成了一个有具体成本数字($3.2 vs $330)和下游指标支撑的对照实验。
核心方法
直觉上,这篇论文做的事是'把一堆工业 PDF 变成一个会做工业选择题的小模型',分四阶段。第一阶段布局感知抽取:用 3B 参数视觉-语言模型 Dots.OCR 逐页解析 PDF(规则方法会破坏表格结构),每页输出含/不含页眉页脚的两个 Markdown、一张区域分类标注 JPG 和结构化 JSON;随后丢弃图片,只留文本与 Markdown 表格,并删除 370 页空白/重复页。第二阶段语义索引:用 EmbeddingGemma(300M 参数,768 维可降至 128 维)做嵌入、FAISS 做向量检索。第三阶段五场景 QA 合成:先从 IBM SensorIQ(5,334 道选择题)随机抽一条'模拟指令'注入提示词保证题型多样,再按场景从知识库召回 1–3 份文档,连同场景规则交给生成模型,输出 JSON 格式的 $q^*$(问题)、$a^*$(正确选项列表)与 options*(恰好 5 个 A–E 选项)。第四阶段过滤与切分:23,910 条原始样本经三道规则过滤器剩 13,557 条,每场景抽 200 条共 1,000 条做基准,余下 12,557 条做训练。
核心创新是把'检索系统的真实失败模式'编码进训练数据。以往合成 QA 数据默认'检索到的文档都有用',模型学到的只是从给定上下文里抄答案,一旦线上检索召回无关文档就开始幻觉。本文定义了五种查询-文档关系 $r_0$–$r_4$:$r_0$ 无关文档(文档与问题主题相关但提供不了任何有用信息,训练模型识别无效证据以抑制幻觉);$r_1$ 单文档线索(只有支持性线索、无显式答案,需推理拼装);$r_2$ 多文档线索(线索散落在多份文档中,需多步整合);$r_3$ 单文档答案(最简单的直接抽取场景);$r_4$ 多文档答案(答案需跨文档多跳拼装)。再配合'指令模拟'机制——每条提示词随机注入一条 SensorIQ 真实选择题、要求生成器模仿其题型与表述(若是多选题则必须输出恰好 5 个 A–E 选项)——数据同时覆盖了检索噪声鲁棒性和多步证据整合两种能力,且题型分布不单一。这是与'朴素文档到问答'式合成数据的本质区别。
方法步骤详情
①人工收集松下官网 906 份 PDF(7,525 页);Dots.OCR 逐页输出 Markdown、区域标注 JPG 和 JSON,291 页(3.8%)抽取失败、表格占 236 页;删图片并清洗 370 页。②EmbeddingGemma + FAISS 建语义索引,页面多为 500 词、最长 2,500 词。③从 SensorIQ 随机抽'模拟指令',按 $r_0$–$r_4$ 场景召回 1–3 份文档填入统一模板(规则 1 定义查询-文档关系;问题须独立成文、禁止元引用;多选题须含 5 个 A–E 选项),交 Qwen3-30B-A3B-Instruct 生成,它在 IFEval 等三项基准上均超 GPT-4o 且开源。④产出 23,910 条原始样本。⑤三道规则过滤器依次核查选项结构(剔除裸标识符)、题干内嵌选项、答案格式($a^*$ 须为字母列表),剩 13,557 条。⑥每场景抽 200 条共 1,000 条做基准、12,557 条训练;Claude-Opus-4.6 重跑同流程得 26,395 条原始、仅 0.5% 被过滤、25,252 条训练的平行版本。
技术新颖性
技术新颖性主要体现在系统组合与受控验证,而非单点算法突破。布局感知抽取、语义索引、LLM 合成 QA、规则过滤每一环都是已知技术,但作者首次把多场景 RAG 合成范式套在真实异构工业文档上并完整开源全部产物(数据、流水线、评测脚本),这在工业领域是新的。评测设计也有心思:鉴于答案本质是集合([A,B] 与 [B,A] 等价),作者弃用对顺序敏感的 Exact-Match,改用集合匹配准确率、$F_1 = \frac{2PR}{P+R}$ 和 Jaccard 相似度 $J = \frac{|A \cap B|}{|A \cup B|}$,并在模型输出后加一层正则化、用正则表达式抽取标准 JSON 答案块,避免解释性文字干扰评分。最有价值的是受控的生成器对照实验:同一流水线、同一提示、同一过滤规则,只换生成模型,从而把过滤率差异(43% vs 0.5%)、成本差异($3.2 vs $330)和 MMLU 遗忘差异(-1.26 vs -0.05 点)干净地归因到生成器本身,这在此前文献中很少被认真做过。
实验结果
(1) 基座:Qwen3-4B-Instruct 在松下基准上集合匹配准确率 28.5%、F1 46.65%,通用 RAG 模型则全崩至约 1%。(2) LoRA(R8–R64)完全无效,各指标与原始持平。(3) 全参微调 Qwen 版:SMA 28.5%→42.0%、F1 46.57%→63.48%,有无 RAG 增益一致。(4) 全参微调 Claude 版:SMA 40.9%→56.4%、F1 58.55%→72.66%,增益约 15 点略高于 Qwen 版的 13.5 点。(5) 通用知识:MMLU(14,042 题)基座 72.13%;Qwen 数据微调后 70.87%(moral_scenarios 暴跌 10.72 点);Claude 版 72.08% 几乎零遗忘。(6) 跨域:Claude 微调使 FailureSensorIQ 原题准确率 34.0%→49.6% 但 F1-Micro 降至 50.3%,Qwen 数据方向相反。(7) 共同短板:所有微调变体在扰动题上准确率均为 0%,松下全崩的 RAG-Instruct 反而 33%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 松下工业基准(Qwen 版数据,有 RAG) | Set-Match Accuracy | 42.0%(全参微调后) | 28.5%(Qwen3-4B-Instruct 原始) | +13.5 个百分点 |
| 松下工业基准(Qwen 版数据,有 RAG) | F1-Score | 63.48% | 46.57% | +16.91 个百分点 |
| 松下工业基准(Claude 版数据,有 RAG) | Set-Match Accuracy | 56.4% | 40.9% | +15.5 个百分点 |
| 松下工业基准(Claude 版数据,有 RAG) | F1-Score | 72.66% | 58.55% | +14.11 个百分点 |
| 松下工业基准(LoRA 微调,R8–R64) | Set-Match Accuracy | 28.2%–28.7% | 28.5%(原始模型) | 无显著提升(LoRA 失效) |
| MMLU 通用知识保持(Claude 版数据微调) | Overall Accuracy(14,042 题) | 72.08% | 72.13%(基座模型) | 仅 -0.05 点,几乎零遗忘 |
| MMLU 通用知识保持(Qwen 版数据微调) | Overall Accuracy(14,042 题) | 70.87% | 72.13%(基座模型) | -1.26 点,人文类降 2.53 点、moral_scenarios 降 10.72 点 |
| FailureSensorIQ 原题(Claude 版数据微调) | AccOrgIBM | 49.6% | 34.0%(Qwen3-4B-Instruct 原始) | +15.6 个百分点(但 F1-Micro 由 66.0% 降至 50.3%) |
局限与改进
作者承认的局限:(1) 扰动鲁棒性完全未解决——无论用哪种数据微调,Qwen3-4B 在 FailureSensorIQ 扰动题 AccPerIBM 上都是 0%,而流水线不生成任何改写变体,这呼应了大模型上扰动最多拉低 41 个百分点的已知现象,在 4B 小模型上表现为全灭;(2) RAG 实现是最简单的基础方案,未探索重排序、混合检索等进阶架构;(3) 两种数据的测试集各自由对应生成器产生,基线分数不可直接比较(28.5% vs 40.9–41.6%),开源与闭源对比只是指示性的;(4) 只保留文本和表格、丢弃全部图片,无法测试多模态理解。我的补充观察:(5) 合成 QA 的事实正确性从未被人工或语义级校验,三道过滤器全是格式规则,43% 的丢弃率说明 Qwen 版原始数据质量波动大,但留下的样本是否真的'答案正确、证据真实存在'仍是未知数;(6) 数据全部来自松下一家厂商的公开文档,跨厂商、跨行业泛化性没有任何验证;(7) 题型锁定为五选多的选择题,无法反映开放式工业问答质量;(8) 训练与评测都集中在 4B 量级,对更小或 7B–13B 模型是否成立未测。
独立分析的弱点
独立分析出的弱点及改进方向:(1) 事实性无校验——多选题的正确选项完全由生成模型自行判定,若生成器幻觉,或底层 Dots.OCR 在密集表格页本来就抽错内容(291 页抽取失败中 236 页因表格),数据会系统性教模型错误知识;改进方向是为每条样本加'答案可从源文档推导'的 NLI/一致性校验,或专家抽样审核。(2) 测试集与训练数据同源同生成器,存在循环性风险:模型可能学的是生成器的措辞习惯而非工业推理;改进方向是引入人工命题或异源外部测试集交叉验证。(3) 扰动脆弱性——训练分布里没有任何改写变体,模型把问题表面形式当成了判断线索;改进方向是作者提议的对抗性改写增广,也可加对比学习目标拉近同义问句的表示。(4) LoRA 失效只被一句'对齐行为、不注入知识'带过,未排查训练轮数、学习率或目标模块的影响,改进方向是系统扫描超参,或改用'继续预训练+指令微调'两阶段的知识注入方案。(5) 每题固定 5 选项、且'即使文档无选项式内容也必须生成 5 项'的硬规则,可能制造大量凑数干扰项,拉低题目区分度与难度分布的真实感。
未来方向
作者提出的方向:(1) 评测更多架构与参数规模的模型,进一步分析泛化性;(2) 纳入多元工业知识来源,构建大规模、综合性的工业基准;(3) 探索基础 RAG 之外的更先进检索架构;(4) 走向多模态,抽取并利用文档内嵌图片、图表与结构化视觉内容,提升真实工业场景下的鲁棒性;(5) 在数据构建时显式生成每题的改写/对抗扰动变体,解决 AccPerIBM=0% 的鲁棒性缺陷,作者称之为未来迭代中最有前景的方向。基于本文成果还可延伸:(6) 用更干净的 Claude 版数据当'教师',蒸馏到 1B 以下端侧模型,契合工业现场的边缘部署需求;(7) 把 $r_0$–$r_4$ 场景体系推广到其他垂直领域(医疗设备手册、法律判例、航空维修记录),验证它是否是合成 QA 数据的通用配方;(8) 系统研究'继续预训练 vs 指令微调'在工业知识注入与遗忘之间的权衡——本文已给出 LoRA 无效、全参有效但可能遗忘的初步信号;(9) 对检索器(EmbeddingGemma)本身在工业语料上做领域适配微调,形成检索与生成的联合优化。
复现评估
复现条件相当友好。代码、数据生成流水线与评测脚本开源于 GitHub(parssky/industrial-instruction),两版数据集存于 Hugging Face(Parssky/industrial-instruction-dataset,DOI 10.57967/hf/10098),57 科目完整 MMLU 分数也在公开评测日志中。算力门槛低:Qwen 版数据生成在单张 Pro 6000 WS 上 1 小时 43 分钟跑完,本地计算成本约 $3.2;全参微调 Qwen3-4B 用两块 RTX 5090 训练 12 小时 3 分钟(有效 batch 64 = 单卡 2 x 梯度累积 32)。难点有三:一是 906 份松下 PDF 需人工从官网整理下载,这一步未自动化;二是复现 Claude 版数据需约 $330 的 API 费用,且闭源模型行为会随版本漂移,严格复现有时效性;三是论文正文未给出完整训练超参(学习率、epoch 数等),需到代码仓库查找。总体属于'有消费级 GPU 即可复现'的中低难度工作。
论文图表
列出 Qwen 版 23,910 条原始样本经各过滤器后的数量:健康选项过滤、题干内嵌选项过滤、删除量与各场景保留量(R0 2,899、R1 2,828、R2 2,816、R3 2,791、R4 2,744),总计约 43% 样本被删除。
精确记录了开源生成器的格式失败率与每个过滤器的拦截规模,是评估规则过滤严格程度和原始数据质量的核心依据。