← 返回 2026-08-19

从语料到协同演化能力:面向通用图像生成的能力中心式数据设计 From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation

Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Qing Jin, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Xiaoli Xu, Zhengze Xu, Hao Yan, Yuhang Yu, Mingzhou Zhang, Mengting Chen 📅 2026-08-18 👍 12 2026-08-24 18:30
图像生成 多模态扩散模型 指令图像编辑 数据策展 文本到图像 课程学习

以能力为单位组织440M文生图、120M编辑与27M知识数据,按依赖顺序编排课程训练通用图像生成模型

前置知识

MM-DiT(多模态扩散 Transformer)

一种将文本 token 与图像 latent token 拼接后在同一 Transformer 主干上做联合注意力去噪的扩散架构,文本与图像各有一套参数但共享注意力计算,是当前文生图与图像编辑统一建模的主流骨干。本文用它从零训练了 3B 和 6B 两个规模的模型。

本文的数据基础设施最终服务于 MM-DiT 的多阶段训练,理解模型侧'从零训练+统一架构'才能明白为何数据组织方式如此重要。

指令图像编辑三元组

指令编辑的标准监督形式:(源图像, 编辑指令, 目标图像)。由于网络上天然成对的样本极稀缺,现有数据集主要靠合成变换、模型生成目标图与自动质量过滤来扩规模,如 AnyEdit、OmniEdit 等。

论文的核心创新之一就是针对这种'合成对主导、真实性不足'的痛点,提出挖掘自然关联图像来构建更真实的编辑对。

课程学习(Curriculum Learning)

按由易到难的顺序组织训练样本,让简单概念为复杂概念打基础。现代文生图系统普遍采用多阶段配方,逐步变化分辨率、数据质量、任务配比与内容复杂度,而非固定数据混合比例。

本文把课程学习从'单一轴变化'升级为任务构成、概念分布、质量、分辨率四轴联动的调度策略,是方法主线之一。

数据重标注(Recaptioning)与合成字幕

网络 alt-text 噪声大,用 VLM 为每张图生成详尽描述替代原始标注可显著提升文本-图像对齐与指令跟随能力,如 DALL-E 3 与 Recap-DataComp-1B 的实践。本文进一步做多粒度(实体/标签/短/中/长/稠密)与中英双语字幕。

字幕在本文中被当作跨任务共享的监督接口:编辑指令继承 T2I 字幕的词汇与描述结构,从而实现概念在任务间迁移。

VLM 评审(VLM-as-judge)

用视觉语言模型代替人工对生成结果打分,本文编辑评测采用 1 到 5 分制,从指令对齐、身份保持等多维度评分。CPI-Bench 即为这一协议下的实用图像编辑基准,含通用与实用子集。

论文唯一的定量表格基于此协议,同时其能力感知评估反馈环也依赖 VLM 打分来发现失败样本,是贯穿全文的评测基础设施。

研究动机

现代图像生成数据管线虽已在规模、质量、再平衡与重标注上取得长足进步(如 LAION-5B、COYO-700M、MMC4 提供数十亿级图文对,Qwen-Image 与 Seedream 重投入于过滤、语义均衡和重标注),但几乎所有传统管线都把任务专属数据集当作独立设计单元:文生图用图-文对、编辑用源-目标对,各自孤立优化。这带来两个具体问题。其一,编辑监督严重依赖合成变换:AnyEdit、OmniEdit、DreamOmni 等以任务专属合成管线为主体扩规模,编辑内容常显得像'贴'上去的,会简化真实世界的变化组合或继承生成器的伪影。其二,不同生成能力并非同时从零涌现,而是有清晰的依赖顺序(如 T2I 语义对齐为结构化生成和编辑提供可复用概念),孤立优化导致跨任务监督无法共享,迫使每个任务数据集重复覆盖同样的视觉概念,且任务级覆盖缺口无法被独立度量。随着模型走向通用图像生成器,'如何组织异构监督以培育相互依赖的能力集合'这一更根本的问题长期未被回答。

本文的目标是本文的目标是把数据策展重构为一套'能力驱动的基础设施',而非若干孤立管线。具体而言:一,构建三个专用且可互操作的数据引擎,分别培育文本-图像接地(T2I)、图像间变换(编辑)、图像-知识关联三类互补的关系监督,并规模化产出 4.4 亿图 T2I 语料、1.2 亿编辑对和 2700 万以上图像-实体对;二,设计一套与能力获取依赖顺序对齐的五阶段课程,沿任务构成、视觉概念分布、数据质量、图像分辨率四个耦合轴联合演化数据;三,用统一字幕框架(从实体标签到长描述、中英双语、稠密字幕)打通任务与粒度,使 T2I 概念可迁移到编辑;四,以此基础设施从零训练 3B 与 6B 两个规模的 MM-DiT 模型,并在 CPI-Bench 上定量、在多样 T2I 与编辑场景中定性验证广覆盖与可迁移性。

与已有工作不同的是,本文的独特切入是把数据设计的'单位'从语料库换成能力。已有工作回答的是'如何把一个语料库做得更好',本文回答'应如何组织数据以协同发育一组相互依赖的生成能力'。具体体现在三处:一,按目标能力切分数据构建(三个引擎),同时通过共享清洗基础设施与标注约定保持可互操作,使各能力的覆盖缺口可独立测量和行动,而无需每个任务数据集复制完整概念分布;二,把字幕当作跨任务、跨粒度的共享语言接口,编辑指令继承 T2I 字幕的视觉词汇与描述结构,已由 T2I 建立的概念无需在编辑数据中重复覆盖;三,把评估从终端测量改造成主动控制信号——能力感知评估发现的失败样本驱动定向检索、专家构造与缺口感知重采样,形成数据与模型共同进化的闭环。

核心方法

直觉上,训练通用图像生成器像教人系统学习:先建立广泛视觉-语义基础,再学结构与知识,最后掌握受控编辑,数据供给必须跟随能力发育的依赖顺序。技术上框架由两大组件耦合。其一是能力专属数据管线,含三个专用引擎:T2I 引擎从十亿级图像池筛选出 4.4 亿图语料,覆盖扩展兼顾实体级长尾概念与'保留可控比例的不完美图像并用字幕描述缺陷';编辑引擎通过算子专属构造(VLM 分解场景、SAM3 提供物体级掩码、反转可观测变化得到增删换与属性对)、自然关联挖掘(同页共现、视频相邻帧、电商拼图切分等)和专家自蒸馏(微调 Qwen-Image-2512、FLUX.2 为任务专家)建成 1.2 亿编辑对;知识引擎从超 1 亿 Wikidata 实体经 PageRank 与 VLM 评估得到约 300 万高显著实体,产出超 2700 万图像-实体对。其二是能力对齐的五阶段课程,从 256px T2I 预训练逐级演进到 1024px SFT,并由能力感知评估闭环驱动定向补数。全程由共享清洗管线(过滤、三级去重、水印/AIGC 检测、28 万层级标签再平衡)支撑。

核心创新是与能力获取依赖顺序对齐的'数据组织方式',而非任何单一模型技巧。与已有方法的本质区别有三点。其一,单位不同:以往以任务数据集为单位孤立优化,本文以能力为单位切分构建,又以共享语义元数据和统一标注接口保持引擎间可互操作——例如 T2I 中合成的文字渲染监督可直接迁移给编辑任务,避免概念重复覆盖。其二,监督来源不同:编辑数据不再由单一合成管线主导,而是算子构造、自然关联挖掘与专家自蒸馏三者互补,自然对(使用前后的商品图、同一产品的多状态等)提供真实、混合的编辑操作监督,克服'贴图感'与生成伪影。其三,训练调度不同:课程不是一次定死的数据配方,而是把任务构成、概念分布、质量、分辨率四轴与能力评估联动,失败样本被标注任务类型与层级语义标签后作为检索种子,持续失败桶上调采样权重、已解决缺口下调,形成数据-模型共同进化的自适应系统。

方法步骤详情

流程分五步。第一步共享清洗:剔除损坏与低分辨率图,模糊/过压缩检测,MD5、pHash、DINOv3+FAISS 三级去重(余弦超 0.99 保留最佳者),过滤水印、AIGC 与 NSFW。第二步元数据与再平衡:28 万+四层细粒度标签,每图检索 top-1000 候选后自适应保留至多 15 个,层级递归重采样。第三步三引擎构造:T2I 引擎产出 4.4 亿图;编辑引擎产出 1.2 亿对,含定量变换与结构表征双向对;知识引擎产出 2700 万+图像-实体对。第四步字幕桥接:两个 Qwen3.5-27B 字幕专家经蒸馏 SFT 与 RL 训练;编辑指令先不看源图生成目标稠密描述,再与源图比对,把可保留内容替换为 [image N] 引用。第五步课程与闭环:Stage1 256px 包容性 T2I 预训练;Stage2 256→512px 引入密文字与知识接地内容;Stage3 512px T2I&Edit 联合;Stage4 512→1024px 持续训练;Stage5 1024px SFT;各检查点做能力分层评估,失败样本驱动检索、专家构造与缺口感知重采样。

技术新颖性

技术新颖性可归纳为四点。一,'能力'作为数据设计原语:把异构监督按依赖关系组织成可独立测量、可独立优化的引擎集合,这在数据策展文献(DataComp、Recap-DataComp-1B 等)与系统实践(Qwen-Image、Seedream)中均未被明确提出。二,自然关联挖掘式编辑数据构造:从同页共现、相邻视频帧、电商拼图切分等自然观察中恢复真实编辑关系,与 AnyEdit/OmniEdit/DreamOmni 的合成管线主导形成方法论对照,为'使用前后''组合与组件'等真实混合编辑提供监督。三,字幕作为跨任务接口的具体机制:编辑指令采用'先盲写目标稠密描述、再以 [image N] 引用替换可保留内容'的对齐算法,使指令天然继承 T2I 词汇结构,训练时模型在编辑分支上复用 T2I 已学概念。四,把课程学习与主动学习结合:能力感知评估将失败样本转化为检索种子与分桶重采样权重,四轴(任务、概念、质量、分辨率)联动调度,评估从终端指标升级为持续控制信号。此外,缺陷感知数据保留(把被丢弃的低质图变成带描述的可识别概念以支撑退化修复)也是少见的反直觉设计。

Capability-specific data construction in our framework. Shared collection and wrangling feed three specialized but interoperable engines for visual expression, editing association, and knowledge-grounded reasoning.
Figure 1: Capability-specific data construction in our framework. Shared collection and wrangling feed three specialized but interoperable engines for visual expression, editing association, and knowledge-grounded reasoning.
Distribution of the curated T2I corpus. The inner ring distinguishes collected and constructed data, while the outer ring reports the composition of visual domains retained for training.
Figure 2: Distribution of the curated T2I corpus. The inner ring distinguishes collected and constructed data, while the outer ring reports the composition of visual domains retained for training.
Composition of the image-editing corpus. The left Sankey diagram shows the relative mixture of single-image and multi-image editing tasks, and the right panels illustrate representative task families.
Figure 3: Composition of the image-editing corpus. The left Sankey diagram shows the relative mixture of single-image and multi-image editing tasks, and the right panels illustrate representative task families.
Multi-granularity T2I supervision. Starting from a comprehensive annotation of an image, we construct entity descriptions, tags, short prompts, and long-form captions at multiple levels of details.
Figure 4: Multi-granularity T2I supervision. Starting from a comprehensive annotation of an image, we construct entity descriptions, tags, short prompts, and long-form captions at multiple levels of details.
Pipeline for constructing T2I-aligned editing instructions. Dual-view perception produces a target-image caption and a raw editing instruction; task-specific actors align local or global changes with reusable T2I descriptions, followed by consistency verification and iterative revision.
Figure 5: Pipeline for constructing T2I-aligned editing instructions. Dual-view perception produces a target-image caption and a raw editing instruction; task-specific actors align local or global changes with reusable T2I descriptions, followed by consistency verification and iterative revision.
Capability-gap-driven active feedback loop. Capability-aware evaluation identifies failure cases, which seed neighboring-data retrieval and expert-driven construction. Gap-aware resampling then increases the weights of persistent failures and down-weights resolved gaps in subsequent training.
Figure 6: Capability-gap-driven active feedback loop. Capability-aware evaluation identifies failure cases, which seed neighboring-data retrieval and expert-driven construction. Gap-aware resampling then increases the weights of persistent failures and down-weights resolved gaps in subsequent training.

实验结果

定量结果集中于编辑:从零训练 3B 与 6B 两个 MM-DiT 模型,在 CPI-Bench 上以 VLM 评分(1-5 分制)评估。3B 在 CPI-General-Bench 得 3.95、CPI-Practical-Bench 得 3.91、Overall 3.93;6B 为 3.96、3.92、Overall 3.94,两者仅差 0.01,暗示该规模区间内数据组织质量比参数量更主导。T2I 仅有定性证据:Figure 7 展示插画、平面设计、知识可视化、多格拼图与摄影风格控制表现良好,归因于引擎富文字语料与课程先广域接地再引入复杂内容。Figure 8 单图编辑对比(对手含 Qwen-Image-Edit-2511、FireRed、JoyAI、Flux.2-klein-9B)显示模型在混合编辑、推理式变换等需推断意图的案例占优,归功于自然关联编辑对的真实监督。Figure 9 验证退化感知修复:因受控保留带缺陷描述的降质图,模型能区分退化与有效内容。Figure 10 多图编辑显示,无论是否用 [image N] 引用,模型都能把视角、服装等属性正确绑定到各参考图。

Qualitative T2I results across illustration, graphic design, knowledge visualization, portraiture, landscapes, multi panel composition, and photographic style control.
Figure 7: Qualitative T2I results across illustration, graphic design, knowledge visualization, portraiture, landscapes, multi panel composition, and photographic style control.
Qualitative comparison on challenging single image editing cases. The examples cover hybrid editing, reasoning based transformation, object segmentation, and style transfer.
Figure 8: Qualitative comparison on challenging single image editing cases. The examples cover hybrid editing, reasoning based transformation, object segmentation, and style transfer.
Visualization of degradation-aware restoration for different degradation types.
Figure 9: Visualization of degradation-aware restoration for different degradation types.
Qualitative comparison on multi image editing. The examples evaluate viewpoint alignment, reference relation understanding, and composition capabilities. Comparison cases are grouped by with/without explicit image index reference.
Figure 10: Qualitative comparison on multi image editing. The examples evaluate viewpoint alignment, reference relation understanding, and composition capabilities. Comparison cases are grouped by with/without explicit image index reference.
查看结构化数据
任务指标本文基线提升
图像编辑(30 类基础任务:20 单图+10 多图) VLM 多维评分(1-5 分制) Our Model-3B: 3.95;Our Model-6B: 3.96 未报告数值基线;Qwen-Image-Edit-2511、FireRed-Image-Edit、JoyAI-Image-Edit-Plus、Flux.2-klein-9B 等仅在 Figure 8/10 中定性对比 CPI-General-Bench 2039 样本上无量化提升幅度可报;定性对比显示在混合编辑与推理编辑上优于对比模型
图像编辑实用场景(4 大领域 51 类应用) VLM 多维评分(1-5 分制) Our Model-3B: 3.91;Our Model-6B: 3.92 未报告数值基线 CPI-Practical-Bench 558 样本上无量化提升幅度可报
图像编辑综合(两子集算术平均) Overall VLM 评分 3B: 3.93;6B: 3.94 未报告数值基线 模型规模从 3B 增至 6B 仅提升 0.01 分,规模收益边际化

局限与改进

作者层面的局限较为隐晦:全文对 T2I 仅给定性展示(Figure 7),未提供 GenEval、DPG-Bench、FID 等任何标准文生图定量指标;编辑定量也只有一张 2 行的小表,未与任何已发表模型同表对比数值,也没有消融实验——五阶段课程、三引擎、自然关联挖掘、缺陷保留等关键设计均无对照数据支撑其有效性;文中提到 CPI-Intelligent-Bench(推理编辑子集)却未报告其结果。我自己的观察:第一,3B 与 6B 仅差 0.01 分,在 VLM-as-judge 的评分噪声范围内,无法据此得出结论,反而暴露评测协议单一;第二,模型对比全部定性且截图由作者挑选,存在选择性展示风险;第三,系统依赖大量不可复现的工业组件(SAM3、Qwen3.5-27B 字幕专家及其 RL、Qwen-Image-2512/FLUX.2/Wan 2.2 专家蒸馏),任何单一环节的知识产权都会阻止完整复现;第四,数据配比、采样权重、阶段 token 数、算力预算全部未公开,论文更像基础设施的技术报告而非可验证研究;第五,'能力依赖顺序'本身是经验性断言,没有反向实验(如乱序课程)证明该顺序最优。

独立分析的弱点

弱点一:评估证据薄弱。唯一定量表格没有外部基线数值,T2I 完全无定量指标,无法判断 3.93/3.94 在领域内的位置;改进方向是补充 GenEval、ImgEdit-Bench 等标准基准并与 Qwen-Image-Edit 等同表对比,报告多次评测方差以证明 0.01 差异是否显著。弱点二:无消融。自然关联编辑对与纯合成对的贡献、缺陷保留比例、五阶段顺序均为未验证假设;改进方向是构造'合成对 only'与'固定混合'对照管线训练同规模小模型做受控消融。弱点三:闭环反馈的成本收益未量化——能力感知评估需对每个检查点跑分层评估并人工复审 SFT 池,链路开销可能抵消收益;应报告闭环相对固定配方的数据效率增益。弱点四:VLM-as-judge 偏差,评分既用于最终基准也用于训练期失败发现,而字幕专家本身由 Qwen3.5-27B 蒸馏,可能造成家族性自我偏好;改进方向是引入异构评审模型与人工校准子集。弱点五:知识引擎的 2700 万图像-实体对只讲构造未评效果,应补实体渲染准确率类评测。弱点六:论文更像基础设施技术报告,配比、采样权重、token 数、算力预算均未公开。

未来方向

作者在结论中把方向指向'将数据组织视为与规模互补的扩展轴'与'自适应监督系统',可延伸的研究有:一,为能力依赖顺序建立可检验的理论或实证模型,例如通过能力涌现时间曲线自动学习课程顺序,替代手工五阶段;二,把闭环反馈形式化为在线优化问题(用 bandit 或强化学习调分桶采样权重),替代当前基于阈值的规则;三,将三引擎框架扩展到视频生成与 3D 生成,视频天然提供时间相邻帧的编辑关系,与本文的自然关联挖掘契合;四,开放能力分层数据基准,让社区能独立验证'能力中心'设计相对'语料中心'设计的增益;五,研究概念迁移的量化方法——本文主张 T2I 概念可迁移至编辑,若能度量迁移率(如冻结不同阶段检查点对比编辑收敛速度),可反哺课程设计;六,探索缺陷保留的数据缩放律:最优'不完美样本'比例可能随模型规模变化,值得系统扫描。此外,CPI-Intelligent-Bench 未报告的结果与推理编辑能力值得后续工作专门研究。

复现评估

完整复现几乎不可行。数据完全未开源:十亿级图像池、4.4 亿 T2I 语料、1.2 亿编辑对、2700 万图像-实体对均为内部资产,层级标签体系(28 万标签)与再平衡策略只给了算法描述。模型未见发布声明。算力上,从零训练 3B 与 6B MM-DiT 五阶段至 1024px,加之每个检查点的能力评估与专家蒸馏(需先微调 Qwen-Image-2512/FLUX.2/Wan 2.2 成任务专家),估计需要数千 GPU 量月的工业级投入。依赖组件中 SAM3、DINOv3、FAISS、BRISQUE、pHash 等可公开获得,但两个 Qwen3.5-27B 字幕专家的 SFT/RL 训练轨迹(利用多教师分歧构造自我验证推理链)细节不足。可复现的部分是:共享清洗管线(附录 A 规则具体到阈值,如簇内余弦 0.99、$256^2$ 像素下限、每图至多 15 个标签),以及 CPI-Bench 若可从文献 [45] 获取则编辑评测协议可复用。建议研究者以小规模代理实验(如 10M 量级语料+开源 DiT)复刻框架结构并做消融,而非追求端到端复现。