基于属性引导体裁扩展的创意写作数据规模化:突破故事中心数据 Scaling Creative Writing Beyond Story-Centric Data with Attribute-Guided Genre Expansion
用人工策划的体裁属性把故事种子扩展成50K条13体裁创意写作数据
前置知识
监督微调(SFT)
用成对的指令-回答数据对预训练语言模型继续训练,使其学会遵循指令格式与任务约定。本文用 LoRA 对 Llama-3.1-8B、EXAONE-3.5-7.8B、Qwen3-8B 三个基模型在 50K 条多体裁数据上各微调 2 个 epoch,然后对比微调前后的写作能力。
本文的贡献单位是训练数据本身,所有实验结论都建立在'SFT 后 vs SFT 前'的对照上,不理解 SFT 就无法读懂其实验设计。
LoRA(低秩适配)
冻结原模型权重,只训练注入各 transformer 层的低秩矩阵增量,大幅降低参数量与显存开销。本文使用 rank=128 的 LoRA 适配所有层,学习率 $1.0\times10^{-5}$,warmup 0.1,全局 batch size 128,cutoff 4096 tokens。
论文的全部训练协议建立在 LoRA 之上,复现实验和解读'保留预训练知识同时注入体裁能力'的设定都需要它。
合成指令数据生成
Self-Instruct、Evol-Instruct、WizardCoder 等方法用 LLM 自动生成指令-回答对来扩充训练数据,在代码、数学等可通过执行结果或最终答案验证的领域已很成熟,但多样性控制和同质化是长期难题。
本文的属性引导体裁扩展属于该路线,但把控制轴从'难度演化'换成'体裁属性注入',理解这一路线才能看清其创新点的相对位置。
LLM-as-a-Judge
用一个(通常更强的)LLM 按评分标准对生成结果打分或对比排序,替代昂贵的人工评测,MT-Bench 是经典范式。其固有风险包括自我偏好、位置偏差等,严谨做法是用多个独立 judge 交叉验证。
本文用它过滤低质量回答,并用 GPT-5-mini、DeepSeek v3.2、Gemini 3 Flash 三个 judge 复核结果,是实验可信度论证的关键环节。
模式坍缩(mode collapse)
LLM 的生成分布过度集中于少数高频模式,导致合成数据看似量大实则同质。verbalized sampling 通过显式要求模型输出多个在话题、语气、结构上各异的候选分布来缓解。
本文在 query 生成阶段显式采用 verbalized sampling,是 50K 数据保持主题多样性、避免模板化的技术保障。
研究动机
现有创意写作语料几乎全部围绕故事生成:WritingPrompts 提供 Reddit 的 prompt-story 对,ROCStories 提供五句话常识故事,LitBench 也只针对故事质量与个性化评估;个别非故事资源如 SongComposer(歌词-旋律对)和 Mirowski et al.(剧本与戏剧协作)只覆盖单一体裁。但真实用户请求远不止故事——他们让模型写说唱段落、游戏设计文档、播客脚本,这些体裁在结构、功能和格式约定上差异巨大:说唱要求押韵方案与 flow,电影剧本依赖叙事弧与对话格式,游戏设计文档需要机制与玩家交互描述。只在故事数据上训练的模型会学到丰富的叙事内容,却无法遵循体裁特有的结构与功能约束。单纯放大故事数据规模也无济于事,因为它不系统编码非故事体裁的形式约定;而 Self-Instruct、Evol-Instruct 等合成指令方法多面向代码、数学等可通过执行约束、最终答案或问题变换近似验证的领域,创意写作缺乏这种紧凑的有效性信号,直接套用会产生话题多样但形式欠约束的 prompt。
本文的目标是本文目标是构建一个可控的规模化框架,把以故事为中心的创意写作数据系统扩展到多种创意体裁,并训练出体裁忠实、主题多样的写作模型。具体而言:以人工创作的故事 prompt 作为主题多样性来源,以人工策划的体裁属性作为结构与格式约束,自动合成覆盖 13 种创意体裁(故事、歌词、说唱、电影剧本、电视剧、游戏设计、播客、杂志、角色设计、对话、戏剧、励志演讲、诗歌,外加日记、漫画脚本、互动小说等长尾格式)的 50K 条 query-response 语料 Multi-Genre Collection;再用它微调 Llama-3.1-8B、EXAONE-3.5-7.8B、Qwen3-8B,要求在 Arena Hard、WritingBench 等分布外基准和自建 Multi-Genre 留出集上同时超越基模型、写作特化的 LongWriter-glm4-9B,以及在 DeepWriting-20k、LongWriter-6k 等现有写作语料上训练的对手。
与已有工作不同的是,本文的独特切入是把主题变化与体裁形式控制解耦为两条正交的控制轴。已有合成指令方法主要沿任务复杂度或问题变体方向演化 prompt(如 Evol-Instruct 让问题逐步变难),主题与形式混在一起无法分别控制;本文则让人类创作的 r/WritingPrompts 种子只负责'写什么'(话题与风格广度),人工策划的体裁属性只负责'怎么写'(结构、风格、格式约定)。第三个关键设计是规格多样性:真实写作指令天然从开放式到高度受约束连续分布,框架通过 $k \sim \mathrm{Uniform}(0, |A_g|)$ 采样属性数量来复现这一分布,$k=0$ 时 query 完全开放,$k$ 增大约束逐步收紧。这既不同于直接收集各体裁 prompt 的做法,也不同于纯自动演化的做法,是一条'人工定义控制维度、自动完成规模扩展'的折中路线,人力成本被压缩到每体裁 5-15 条属性的定义与审核上。
核心方法
直觉上,把一个故事 prompt 变成忠实于目标体裁的写作指令需要两样东西:话题灵感(写什么)和体裁约定(怎么写)。框架分三步把两者组装:先从 r/WritingPrompts 种子池随机采 $n=5$ 个故事 prompt 作主题种子,再从目标体裁属性集 $A_g$(每体裁 5-15 个人工审核的结构维度,如说唱的押韵方案与 flow)中采 $k$ 个属性,再用元提示模板 $T$ 把任务指令、few-shot 示例、目标体裁与属性拼成结构化 prompt。形式化地,设 $(q_g, y)$ 为体裁 $g$ 的 query-response 对,$X=\{(q_{story,i}, y_i)\}_{i=1}^n$ 为种子集,$A \subseteq A_g$ 为采样子集,则 query 由 $Q = \mathrm{LLM}\, T(g, X, A)$ 生成。query 由 GPT-5-mini 生成,回答由 Qwen3-235B-A22B-Thinking 生成,最后经 LLM-as-a-Judge 过滤,产出 50K 条、13 体裁的 Multi-Genre Collection。
核心创新是把'主题广度'与'体裁形式保真'分离成两个可独立控制的旋钮,用人工策划的体裁属性取代自动演化作为形式约束的来源。与 Self-Instruct/Evol-Instruct 的本质区别在于控制轴:后者按任务难度或问题变换演化,无法保证体裁形式;前者由权威定义中提炼的结构维度直接决定指令的形态。属性构建流程保证了质量:从 Wikipedia 和创意写作手册等权威来源收集体裁定义,用 GPT-5 抽取结构化属性列表,再人工审核——验证每条属性确实是该体裁真实存在的结构约定、合并重叠项、删除过于泛化的项、补充自动抽取遗漏的显著维度,最终每体裁得到 5-15 个属性(如说唱的 Rhyme Scheme/Rhyme Density/Flow/Punchlines/Wordplay,电视剧的叙事弧与角色发展)。属性采样数量 $k \sim \mathrm{Uniform}(0, |A_g|)$ 则充当指令具体性的控制机制,使语料自然覆盖从开放式到强约束的完整谱系。
方法步骤详情
第一步(数据源策划):选 r/WritingPrompts 为种子池,GPT-5-mini 做两道过滤——安全过滤移除 686 条有害内容,无关清理移除 861 条离题碎片。第二步(主题种子采样):每次模板实例化随机采 $n=5$ 个 query-response 对,把故事 prompt 的话题广度迁移到非故事体裁。第三步(体裁属性采样):13 个体裁各维护 5-15 个属性集 $A_g$;采样 $k \sim \mathrm{Uniform}(0, |A_g|)$ 后随机选子集 $A$($|A|=k$),$k=0$ 得开放式指令。第四步(配对合成):将任务指令、$k$ 个属性、$n=5$ 个 few-shot 种子填入元提示模板,GPT-5-mini 每次生成 5 条 query,以 verbalized sampling 防模式坍缩;随后 Qwen3-235B-A22B-Thinking 生成回答,Qwen3-30B-A3B-Instruct 做 judge 打分,剔除低于均值两个标准差的配对。最终语料体裁级均衡:多数体裁各 3,389 条(6.8%)。
技术新颖性
新颖性体现在四个层面。其一,问题定位新颖:首次把'故事中心数据'识别为创意写作模型的结构性盲区,并提炼出系统体裁覆盖、体裁形式保真、规格多样性三条明确需求,此前 SongComposer(仅歌词)、Mirowski et al.(仅剧本)等只做单体裁补丁。其二,机制新颖:属性引导注入是'人工知识进管道、规模扩展靠模型'设计模式的干净实例化——唯一人工产物是每体裁 5-15 条属性,其余全部自动,与完全人工标注或完全自动演化两个极端都不同。其三,数据资产新颖:50K 条、13 体裁、体裁级均衡的 Multi-Genre Collection 填补了单体裁资源与故事资源之间的空白。其四,评估设计贡献:用 Qwen3-Embedding-0.6B 嵌入加 t-SNE 验证体裁聚类清晰、重叠极少,证明产物是体裁可分的指令分布而非故事 prompt 的改写;再用体裁数消融(0→13 体裁,novelty 3.87→4.81)把'体裁多样性'与'输出新颖性'建立为单调因果证据,这是对该领域'数据多样性是否有用'争论的直接回应。
实验结果
五组实验支撑结论。第一,SFT 全面提升(Table 1):Llama-3.1-8B 在 Arena Hard 从 2.9 升至 33.0(+30.1),WritingBench 43.7→60.6(+16.9),Multi-Genre 留出集 44.4→68.4(+24.0);Qwen3-8B 为 8.0→34.2、56.1→63.6、67.7→69.3;EXAONE 为 10.4→22.9、52.7→59.4、64.9→66.2;全部超过写作特化的 LongWriter-glm4-9B(2.3/47.2/49.5)。第二,与现有语料公平比较(Table 2,各 2K 子集训 Qwen3-8B):WritingBench 59.1 优于 LongWriter-6k 的 56.4 与 DeepWriting-20k 的 55.5。第三,体裁数消融(Table 3):训练体裁 0/4/8/12/13 对应 NoveltyBench Distinct 单调上升 3.87→3.93→4.26→4.56→4.81。第四,独立 judge 复核(Table 4):DeepSeek v3.2 下 Llama+SFT 63.1 对基座 36.6,Gemini 3 Flash 下 70.5 对 41.7。第五,人工评测(Table 5):59.3 对 LongWriter 57.7。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Arena Hard (Creative Writing) v2.0,英文样本 | GPT-4.1 对照参考答案判分 | Qwen3-8B+SFT 34.2;Llama+SFT 33.0 | Qwen3-8B 基座 8.0;Llama 基座 2.9 | +26.2 / +30.1 |
| WritingBench(广告营销与文学艺术域) | GPT-5-mini 按原协议判分 | Llama+SFT 60.6;Qwen3+SFT 63.6 | Llama 基座 43.7;LongWriter-glm4-9B 47.2 | +16.9,且超特化基线 13.4 |
| Multi-Genre 留出集(13 体裁 × 50 条 = 650 条) | GPT-4.1 按 1-10 评质量/创意/体裁遵循 | Llama+SFT 68.4;Qwen3+SFT 69.3 | Llama 基座 44.4;LongWriter 49.5 | +24.0 |
| 2K 子集公平比较(Qwen3-8B 分别微调) | WritingBench / Multi-Genre | Multi-Genre Collection 59.1 / 71.4 | LongWriter-6k 56.4 / 69.6;DeepWriting-20k 55.5 / 65.9 | +2.7 / +1.8(对最强基线) |
| 输出新颖性(NoveltyBench Distinct) | 语义等价聚类后的输出独特性 | 13 体裁训练得 4.81 | 仅故事(0 额外体裁)3.87 | +0.94,随体裁数单调上升 |
| WritingBench 人工评测(50 条 prompt) | 人工评分 | Multi-Genre 59.3 | LongWriter 57.7;DeepWriting 56.9 | +1.6(对 LongWriter) |
局限与改进
作者承认的局限:语料为纯英文;GPT-5-mini 同时担任 query 生成器与默认 judge,存在自我偏好风险——他们用 DeepSeek v3.2、Gemini 3 Flash 两个独立 judge 和人工评测缓解;人评只覆盖 50 条 prompt,规模有限。我补充几点:Multi-Genre 留出集的参考答案同样来自 Qwen3-235B-A22B-Thinking,与训练数据同源,该指标存在循环性,EXAONE/Qwen3 上仅 +1.3/+1.6 的小提升可能被同源偏置放大;response 全部由单一模型生成,数据会继承其风格与知识偏置;13 个体裁与属性集由作者人工圈定,每扩展一个新体裁或语言都要重新人工策划,框架的可扩展性部分依赖这份人工清单;WritingBench 上对 LongWriter 的领先仅 +2.7,处于 LLM judge 噪声区间边缘;论文未报告数据生成成本、未做全参数微调对照,也没有属性约束忠实度的独立自动指标。
独立分析的弱点
第一,数据完全合成:query 来自 GPT-5-mini、response 来自 Qwen3-235B-A22B-Thinking,知识边界与风格偏置被上游模型封顶,Etc. 类长尾体裁(日记、漫画脚本、互动小说)可能模板化严重;改进方向是引入多源 response 集成,或对同一 query 采样多个回答择优保留。第二,人工策划属性随体裁数线性增长,迁移到小语种或新兴体裁需重复劳动;可改为'自动挖掘候选属性+人工抽检'的半自动流程。第三,质量过滤只做'低于均值两个标准差即剔除'的截断,judge 分数本身没有被复用——同一批分数天然构成偏好信号,却只用于丢弃;改进方向是基于分数构建 chosen/rejected 对做 DPO,把 50K 数据的价值再榨一遍。第四,评测侧 WritingBench 对 LongWriter 的差距(59.1 vs 56.4)小于 judge 波动,且留出集参考答案与训练数据同源;应扩充人评规模,引入与生成模型解耦的体裁忠实度指标如格式规则匹配率。第五,仅验证 LoRA rank 128 一种训练配置,属性数据的潜力可能被训练配方低估。
未来方向
作者指出的方向:体裁数量与新颖性的关系值得继续推进——Table 3 显示 0→13 体裁单调上升(3.87→4.81),但未探索饱和点以及更多体裁、长尾格式与多模态写作的组合效应。基于成果可延伸的方向:其一,跨语言体裁扩展,把属性集本地化到中文、韩文等语言,检验框架的文化与语言迁移性;其二,把属性控制从训练期推进到推理期,训练一个接受属性向量条件的模型,运行时按 $k$ 与属性组合精确控制输出形式,实现可控生成;其三,将 judge 分数升级为偏好数据做 DPO/RLAIF,直接优化体裁忠实度;其四,自动体裁发现——用聚类在真实用户请求中挖掘新体裁并自动起草属性,形成体裁清单的闭环扩展;其五,评估改革:构建与生成模型解耦的体裁忠实度基准(格式规则覆盖率、结构校验器),替代同源参考答案;其六,与长文本能力结合,游戏设计文档、剧本等体裁天然要求数千 token 的结构一致输出,可研究体裁数据对长程规划与格式保持能力的迁移。
复现评估
复现难度中等,主要障碍在数据而非训练。训练侧协议完整且轻量:LlamaFactory + LoRA(rank 128、全部 transformer 层)、2 epochs、cutoff 4096、学习率 $1.0\times10^{-5}$、warmup 0.1、全局 batch 128,8B 级模型单机多卡即可完成。数据侧依赖四个模型——GPT-5(属性抽取)、GPT-5-mini(种子过滤与 query 生成)、Qwen3-235B-A22B-Thinking(response 生成)、Qwen3-30B-A3B-Instruct(judge)——50K 条数据的 API 成本可观且论文未给用量估算;属性清单与最终数据集在正文中均无开源链接,CIKM 6 页短文也没有附录代码,复现者需向作者索取或完全重造属性集。基准侧 Arena Hard、WritingBench、NoveltyBench 均公开,但 judge 需 GPT-4.1/GPT-5-mini 等闭源模型,同样产生费用。建议先在单体裁约 1K 条上跑通管道并检查属性遵循度,再决定是否全量重造。
论文图表
用 GPT-5-mini、DeepSeek v3.2、Gemini 3 Flash 三个独立 judge 重评 WritingBench:Llama+SFT 得 60.6/63.1/70.5,全面高于基座 Llama 的 43.7/36.6/41.7;Qwen3+SFT 得 63.6/65.9/71.5,高于 Qwen3 的 56.1/51.5/58.5。
回应'query 生成器与 judge 同为 GPT-5-mini 造成自我偏好'的质疑,证明增益不是评测器伪影,是结论可信度的必要验证。
从 WritingBench 随机抽 50 条 prompt 做人工评分:Multi-Genre 数据训出的模型得 59.3,高于 LongWriter 的 57.7 与 DeepWriting 的 56.9。
人工评测是 LLM judge 结论的最终佐证,规模虽小但补齐了'机器评测是否反映人类偏好'这最后一环。