从语料到协同演化能力:面向通用图像生成的能力中心式数据设计 From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation
以能力为单位组织440M文生图、120M编辑与27M知识数据,按依赖顺序编排课程训练通用图像生成模型
前置知识
MM-DiT(多模态扩散 Transformer)
一种将文本 token 与图像 latent token 拼接后在同一 Transformer 主干上做联合注意力去噪的扩散架构,文本与图像各有一套参数但共享注意力计算,是当前文生图与图像编辑统一建模的主流骨干。本文用它从零训练了 3B 和 6B 两个规模的模型。
本文的数据基础设施最终服务于 MM-DiT 的多阶段训练,理解模型侧'从零训练+统一架构'才能明白为何数据组织方式如此重要。
指令图像编辑三元组
指令编辑的标准监督形式:(源图像, 编辑指令, 目标图像)。由于网络上天然成对的样本极稀缺,现有数据集主要靠合成变换、模型生成目标图与自动质量过滤来扩规模,如 AnyEdit、OmniEdit 等。
论文的核心创新之一就是针对这种'合成对主导、真实性不足'的痛点,提出挖掘自然关联图像来构建更真实的编辑对。
课程学习(Curriculum Learning)
按由易到难的顺序组织训练样本,让简单概念为复杂概念打基础。现代文生图系统普遍采用多阶段配方,逐步变化分辨率、数据质量、任务配比与内容复杂度,而非固定数据混合比例。
本文把课程学习从'单一轴变化'升级为任务构成、概念分布、质量、分辨率四轴联动的调度策略,是方法主线之一。
数据重标注(Recaptioning)与合成字幕
网络 alt-text 噪声大,用 VLM 为每张图生成详尽描述替代原始标注可显著提升文本-图像对齐与指令跟随能力,如 DALL-E 3 与 Recap-DataComp-1B 的实践。本文进一步做多粒度(实体/标签/短/中/长/稠密)与中英双语字幕。
字幕在本文中被当作跨任务共享的监督接口:编辑指令继承 T2I 字幕的词汇与描述结构,从而实现概念在任务间迁移。
VLM 评审(VLM-as-judge)
用视觉语言模型代替人工对生成结果打分,本文编辑评测采用 1 到 5 分制,从指令对齐、身份保持等多维度评分。CPI-Bench 即为这一协议下的实用图像编辑基准,含通用与实用子集。
论文唯一的定量表格基于此协议,同时其能力感知评估反馈环也依赖 VLM 打分来发现失败样本,是贯穿全文的评测基础设施。
研究动机
现代图像生成数据管线虽已在规模、质量、再平衡与重标注上取得长足进步(如 LAION-5B、COYO-700M、MMC4 提供数十亿级图文对,Qwen-Image 与 Seedream 重投入于过滤、语义均衡和重标注),但几乎所有传统管线都把任务专属数据集当作独立设计单元:文生图用图-文对、编辑用源-目标对,各自孤立优化。这带来两个具体问题。其一,编辑监督严重依赖合成变换:AnyEdit、OmniEdit、DreamOmni 等以任务专属合成管线为主体扩规模,编辑内容常显得像'贴'上去的,会简化真实世界的变化组合或继承生成器的伪影。其二,不同生成能力并非同时从零涌现,而是有清晰的依赖顺序(如 T2I 语义对齐为结构化生成和编辑提供可复用概念),孤立优化导致跨任务监督无法共享,迫使每个任务数据集重复覆盖同样的视觉概念,且任务级覆盖缺口无法被独立度量。随着模型走向通用图像生成器,'如何组织异构监督以培育相互依赖的能力集合'这一更根本的问题长期未被回答。
本文的目标是本文的目标是把数据策展重构为一套'能力驱动的基础设施',而非若干孤立管线。具体而言:一,构建三个专用且可互操作的数据引擎,分别培育文本-图像接地(T2I)、图像间变换(编辑)、图像-知识关联三类互补的关系监督,并规模化产出 4.4 亿图 T2I 语料、1.2 亿编辑对和 2700 万以上图像-实体对;二,设计一套与能力获取依赖顺序对齐的五阶段课程,沿任务构成、视觉概念分布、数据质量、图像分辨率四个耦合轴联合演化数据;三,用统一字幕框架(从实体标签到长描述、中英双语、稠密字幕)打通任务与粒度,使 T2I 概念可迁移到编辑;四,以此基础设施从零训练 3B 与 6B 两个规模的 MM-DiT 模型,并在 CPI-Bench 上定量、在多样 T2I 与编辑场景中定性验证广覆盖与可迁移性。
与已有工作不同的是,本文的独特切入是把数据设计的'单位'从语料库换成能力。已有工作回答的是'如何把一个语料库做得更好',本文回答'应如何组织数据以协同发育一组相互依赖的生成能力'。具体体现在三处:一,按目标能力切分数据构建(三个引擎),同时通过共享清洗基础设施与标注约定保持可互操作,使各能力的覆盖缺口可独立测量和行动,而无需每个任务数据集复制完整概念分布;二,把字幕当作跨任务、跨粒度的共享语言接口,编辑指令继承 T2I 字幕的视觉词汇与描述结构,已由 T2I 建立的概念无需在编辑数据中重复覆盖;三,把评估从终端测量改造成主动控制信号——能力感知评估发现的失败样本驱动定向检索、专家构造与缺口感知重采样,形成数据与模型共同进化的闭环。
核心方法
直觉上,训练通用图像生成器像教人系统学习:先建立广泛视觉-语义基础,再学结构与知识,最后掌握受控编辑,数据供给必须跟随能力发育的依赖顺序。技术上框架由两大组件耦合。其一是能力专属数据管线,含三个专用引擎:T2I 引擎从十亿级图像池筛选出 4.4 亿图语料,覆盖扩展兼顾实体级长尾概念与'保留可控比例的不完美图像并用字幕描述缺陷';编辑引擎通过算子专属构造(VLM 分解场景、SAM3 提供物体级掩码、反转可观测变化得到增删换与属性对)、自然关联挖掘(同页共现、视频相邻帧、电商拼图切分等)和专家自蒸馏(微调 Qwen-Image-2512、FLUX.2 为任务专家)建成 1.2 亿编辑对;知识引擎从超 1 亿 Wikidata 实体经 PageRank 与 VLM 评估得到约 300 万高显著实体,产出超 2700 万图像-实体对。其二是能力对齐的五阶段课程,从 256px T2I 预训练逐级演进到 1024px SFT,并由能力感知评估闭环驱动定向补数。全程由共享清洗管线(过滤、三级去重、水印/AIGC 检测、28 万层级标签再平衡)支撑。
核心创新是与能力获取依赖顺序对齐的'数据组织方式',而非任何单一模型技巧。与已有方法的本质区别有三点。其一,单位不同:以往以任务数据集为单位孤立优化,本文以能力为单位切分构建,又以共享语义元数据和统一标注接口保持引擎间可互操作——例如 T2I 中合成的文字渲染监督可直接迁移给编辑任务,避免概念重复覆盖。其二,监督来源不同:编辑数据不再由单一合成管线主导,而是算子构造、自然关联挖掘与专家自蒸馏三者互补,自然对(使用前后的商品图、同一产品的多状态等)提供真实、混合的编辑操作监督,克服'贴图感'与生成伪影。其三,训练调度不同:课程不是一次定死的数据配方,而是把任务构成、概念分布、质量、分辨率四轴与能力评估联动,失败样本被标注任务类型与层级语义标签后作为检索种子,持续失败桶上调采样权重、已解决缺口下调,形成数据-模型共同进化的自适应系统。
方法步骤详情
流程分五步。第一步共享清洗:剔除损坏与低分辨率图,模糊/过压缩检测,MD5、pHash、DINOv3+FAISS 三级去重(余弦超 0.99 保留最佳者),过滤水印、AIGC 与 NSFW。第二步元数据与再平衡:28 万+四层细粒度标签,每图检索 top-1000 候选后自适应保留至多 15 个,层级递归重采样。第三步三引擎构造:T2I 引擎产出 4.4 亿图;编辑引擎产出 1.2 亿对,含定量变换与结构表征双向对;知识引擎产出 2700 万+图像-实体对。第四步字幕桥接:两个 Qwen3.5-27B 字幕专家经蒸馏 SFT 与 RL 训练;编辑指令先不看源图生成目标稠密描述,再与源图比对,把可保留内容替换为 [image N] 引用。第五步课程与闭环:Stage1 256px 包容性 T2I 预训练;Stage2 256→512px 引入密文字与知识接地内容;Stage3 512px T2I&Edit 联合;Stage4 512→1024px 持续训练;Stage5 1024px SFT;各检查点做能力分层评估,失败样本驱动检索、专家构造与缺口感知重采样。
技术新颖性
技术新颖性可归纳为四点。一,'能力'作为数据设计原语:把异构监督按依赖关系组织成可独立测量、可独立优化的引擎集合,这在数据策展文献(DataComp、Recap-DataComp-1B 等)与系统实践(Qwen-Image、Seedream)中均未被明确提出。二,自然关联挖掘式编辑数据构造:从同页共现、相邻视频帧、电商拼图切分等自然观察中恢复真实编辑关系,与 AnyEdit/OmniEdit/DreamOmni 的合成管线主导形成方法论对照,为'使用前后''组合与组件'等真实混合编辑提供监督。三,字幕作为跨任务接口的具体机制:编辑指令采用'先盲写目标稠密描述、再以 [image N] 引用替换可保留内容'的对齐算法,使指令天然继承 T2I 词汇结构,训练时模型在编辑分支上复用 T2I 已学概念。四,把课程学习与主动学习结合:能力感知评估将失败样本转化为检索种子与分桶重采样权重,四轴(任务、概念、质量、分辨率)联动调度,评估从终端指标升级为持续控制信号。此外,缺陷感知数据保留(把被丢弃的低质图变成带描述的可识别概念以支撑退化修复)也是少见的反直觉设计。
实验结果
定量结果集中于编辑:从零训练 3B 与 6B 两个 MM-DiT 模型,在 CPI-Bench 上以 VLM 评分(1-5 分制)评估。3B 在 CPI-General-Bench 得 3.95、CPI-Practical-Bench 得 3.91、Overall 3.93;6B 为 3.96、3.92、Overall 3.94,两者仅差 0.01,暗示该规模区间内数据组织质量比参数量更主导。T2I 仅有定性证据:Figure 7 展示插画、平面设计、知识可视化、多格拼图与摄影风格控制表现良好,归因于引擎富文字语料与课程先广域接地再引入复杂内容。Figure 8 单图编辑对比(对手含 Qwen-Image-Edit-2511、FireRed、JoyAI、Flux.2-klein-9B)显示模型在混合编辑、推理式变换等需推断意图的案例占优,归功于自然关联编辑对的真实监督。Figure 9 验证退化感知修复:因受控保留带缺陷描述的降质图,模型能区分退化与有效内容。Figure 10 多图编辑显示,无论是否用 [image N] 引用,模型都能把视角、服装等属性正确绑定到各参考图。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 图像编辑(30 类基础任务:20 单图+10 多图) | VLM 多维评分(1-5 分制) | Our Model-3B: 3.95;Our Model-6B: 3.96 | 未报告数值基线;Qwen-Image-Edit-2511、FireRed-Image-Edit、JoyAI-Image-Edit-Plus、Flux.2-klein-9B 等仅在 Figure 8/10 中定性对比 | CPI-General-Bench 2039 样本上无量化提升幅度可报;定性对比显示在混合编辑与推理编辑上优于对比模型 |
| 图像编辑实用场景(4 大领域 51 类应用) | VLM 多维评分(1-5 分制) | Our Model-3B: 3.91;Our Model-6B: 3.92 | 未报告数值基线 | CPI-Practical-Bench 558 样本上无量化提升幅度可报 |
| 图像编辑综合(两子集算术平均) | Overall VLM 评分 | 3B: 3.93;6B: 3.94 | 未报告数值基线 | 模型规模从 3B 增至 6B 仅提升 0.01 分,规模收益边际化 |
局限与改进
作者层面的局限较为隐晦:全文对 T2I 仅给定性展示(Figure 7),未提供 GenEval、DPG-Bench、FID 等任何标准文生图定量指标;编辑定量也只有一张 2 行的小表,未与任何已发表模型同表对比数值,也没有消融实验——五阶段课程、三引擎、自然关联挖掘、缺陷保留等关键设计均无对照数据支撑其有效性;文中提到 CPI-Intelligent-Bench(推理编辑子集)却未报告其结果。我自己的观察:第一,3B 与 6B 仅差 0.01 分,在 VLM-as-judge 的评分噪声范围内,无法据此得出结论,反而暴露评测协议单一;第二,模型对比全部定性且截图由作者挑选,存在选择性展示风险;第三,系统依赖大量不可复现的工业组件(SAM3、Qwen3.5-27B 字幕专家及其 RL、Qwen-Image-2512/FLUX.2/Wan 2.2 专家蒸馏),任何单一环节的知识产权都会阻止完整复现;第四,数据配比、采样权重、阶段 token 数、算力预算全部未公开,论文更像基础设施的技术报告而非可验证研究;第五,'能力依赖顺序'本身是经验性断言,没有反向实验(如乱序课程)证明该顺序最优。
独立分析的弱点
弱点一:评估证据薄弱。唯一定量表格没有外部基线数值,T2I 完全无定量指标,无法判断 3.93/3.94 在领域内的位置;改进方向是补充 GenEval、ImgEdit-Bench 等标准基准并与 Qwen-Image-Edit 等同表对比,报告多次评测方差以证明 0.01 差异是否显著。弱点二:无消融。自然关联编辑对与纯合成对的贡献、缺陷保留比例、五阶段顺序均为未验证假设;改进方向是构造'合成对 only'与'固定混合'对照管线训练同规模小模型做受控消融。弱点三:闭环反馈的成本收益未量化——能力感知评估需对每个检查点跑分层评估并人工复审 SFT 池,链路开销可能抵消收益;应报告闭环相对固定配方的数据效率增益。弱点四:VLM-as-judge 偏差,评分既用于最终基准也用于训练期失败发现,而字幕专家本身由 Qwen3.5-27B 蒸馏,可能造成家族性自我偏好;改进方向是引入异构评审模型与人工校准子集。弱点五:知识引擎的 2700 万图像-实体对只讲构造未评效果,应补实体渲染准确率类评测。弱点六:论文更像基础设施技术报告,配比、采样权重、token 数、算力预算均未公开。
未来方向
作者在结论中把方向指向'将数据组织视为与规模互补的扩展轴'与'自适应监督系统',可延伸的研究有:一,为能力依赖顺序建立可检验的理论或实证模型,例如通过能力涌现时间曲线自动学习课程顺序,替代手工五阶段;二,把闭环反馈形式化为在线优化问题(用 bandit 或强化学习调分桶采样权重),替代当前基于阈值的规则;三,将三引擎框架扩展到视频生成与 3D 生成,视频天然提供时间相邻帧的编辑关系,与本文的自然关联挖掘契合;四,开放能力分层数据基准,让社区能独立验证'能力中心'设计相对'语料中心'设计的增益;五,研究概念迁移的量化方法——本文主张 T2I 概念可迁移至编辑,若能度量迁移率(如冻结不同阶段检查点对比编辑收敛速度),可反哺课程设计;六,探索缺陷保留的数据缩放律:最优'不完美样本'比例可能随模型规模变化,值得系统扫描。此外,CPI-Intelligent-Bench 未报告的结果与推理编辑能力值得后续工作专门研究。
复现评估
完整复现几乎不可行。数据完全未开源:十亿级图像池、4.4 亿 T2I 语料、1.2 亿编辑对、2700 万图像-实体对均为内部资产,层级标签体系(28 万标签)与再平衡策略只给了算法描述。模型未见发布声明。算力上,从零训练 3B 与 6B MM-DiT 五阶段至 1024px,加之每个检查点的能力评估与专家蒸馏(需先微调 Qwen-Image-2512/FLUX.2/Wan 2.2 成任务专家),估计需要数千 GPU 量月的工业级投入。依赖组件中 SAM3、DINOv3、FAISS、BRISQUE、pHash 等可公开获得,但两个 Qwen3.5-27B 字幕专家的 SFT/RL 训练轨迹(利用多教师分歧构造自我验证推理链)细节不足。可复现的部分是:共享清洗管线(附录 A 规则具体到阈值,如簇内余弦 0.99、$256^2$ 像素下限、每图至多 15 个标签),以及 CPI-Bench 若可从文献 [45] 获取则编辑评测协议可复用。建议研究者以小规模代理实验(如 10M 量级语料+开源 DiT)复刻框架结构并做消融,而非追求端到端复现。
论文图表
唯一的定量结果表:Our Model-3B(3.95/3.91/Overall 3.93)与 Our Model-6B(3.96/3.92/Overall 3.94)在 CPI-General-Bench(2039 样本、30 类任务)与 CPI-Practical-Bench(558 样本、4 领域 51 类应用)上的 VLM 评分,1-5 分制。
全文唯一量化证据所在。既给出性能绝对值,也暴露了两个重要事实:无外部基线数值对比,以及 3B 到 6B 仅 0.01 分的规模边际效应,这两点对评估论文说服力至关重要。