← 返回 2026-07-22

SciForma:面向结构保真的科学流程图生成 SciForma: Structure-Faithful Generation of Scientific Diagrams

Yuxuan Luo, Peng Zhang, Xinjie Zhang, Xun Guo, Zhouhui Lian, Yan Lu 📅 2026-07-20 👍 22 2026-07-27 18:30
偏好优化(DPO) 图文渲染 扩散模型后训练 科学图像生成 结构保真

三轴解构+联合偏好优化,让开源模型逼近商用图模型

前置知识

Flow Matching / DiT (扩散变换器)

扩散模型的一种训练范式:网络学习一个速度场 $v_\theta(x_t, t)$ 去匹配从噪声 $\varepsilon$ 到数据 $x$ 的线性插值路径,损失为 $\mathcal{L}_\theta(x) = \| v_\theta(x_t, t) - (\varepsilon - x) \|^2$。FLUX.2-klein-base-9B 就是基于 DiT 的开源底座。训练时把源图与目标图的潜变量沿序列维度拼接、并加上 RoPE 时间偏移(本文 $T_\text{source}=10, T_\text{target}=0$),就能让同一架构同时做生成和局部编辑。

SciForma 的所有 SFT 和 M-DPO 训练都建立在 flow-matching 损失之上;理解这一点才能看懂 M-DPO 如何把隐式奖励定义在「同一损失」上。

DPO (Direct Preference Optimization)

绕过显式奖励模型的偏好对齐方法:通过构造 $(y^+, y^-)$ 偏好对,直接最大化策略对获胜样本 $y^+$ 的隐式奖励优势 $\Delta = \mathcal{L}^\text{ref}_{y^+} - \mathcal{L}^\theta_{y^+} - \mathcal{L}^\text{ref}_{y^-} - \mathcal{L}^\theta_{y^-}$,等价于损失 $\mathcal{L}=\log(1+\exp(-\beta\Delta))=-\log\sigma(\beta\Delta)$。M-DPO 把它推广到 $D$ 个轴向的「联合」偏好,$D=1$ 时正好退化为标准 DPO。

M-DPO 的核心创新就是改造 DPO 让它强制「同时」满足所有轴;不熟悉 DPO 就无法理解为什么作者要拒绝标量奖励方法。

Bradley–Terry 多路偏好模型

把两两比较推广为「一个获胜者同时击败 $D$ 个对手」的概率模型 $P(y^+ \succ y^-_1, \ldots, y^-_D) = \frac{\exp(r^+)}{\exp(r^+) + \sum_d \exp(r^-_d)}$,取负对数似然得到 $\log(1 + \sum_d \exp(r^-_d - r^+))$。这正是 M-DPO 联合损失的来源,它也等价于负样本是「被刻意挖出来的结构失效模式」的 InfoNCE。

它解释了 M-DPO 的「联合」语义——必须同时在所有维度上击败才得分,这是本文方法区别于标量 DPO 的理论根基。

结构清单 (Structural Inventory)

本文借鉴 UML 活动图与 BPMN 流程标准,把一张方法图拆成三条可独立验证的轴:Component(C,模块/形状/位置)、Arrow(A,有向连接的起止对)、Text(T,逐字文本标签),用 VLM 把参照图抽成 JSON 清单。任何生成图必须命中清单中每一项,错一项就判失败,按严重度赋权重 $w_e$:critical $=1.0$,moderate $=0.5$。

结构清单是本文全部工作的基石:它定义评估指标、驱动 M-DPO 的样本构造,又在推理时驱动闭环编辑。

Aspect-Ratio Bucketing / 16×16 VAE 网格

训练时按宽高比分桶保证同批图像空间同质;编辑时把 GPT-5.4 给出的检测框 $\tilde{x}_1=16\lfloor\max(0,x_1-p)/16\rfloor$ 对齐到 VAE 的 16×16 潜格,避免裁剪破坏潜空间结构。SciFormaData 中 89.5% 是横版图,中位宽高比 2.03。

理解这些工程细节才能看懂 Stage-2 SFT 如何把生成与编辑拼到一个模型里,以及推理时为什么能做局部重绘。

研究动机

科学论文里的方法图(流水线、架构总览)和普通自然图像有本质区别:它的价值不在「看起来漂亮」,而在「结构保真」——每个模块、每条箭头的方向、每个文字标注都必须清晰可读。哪怕只有一个箭头画反、一个公式下标糊掉,整张图传达的研究逻辑就失效了。论文把这种特性称为「联合正确性 / 不可补偿性」(conjunctive, non-compensatory):一个轴上的优势无法弥补另一个轴上的失败。然而当前开源模型在这类图上系统性落后:表 2a 中 FLUX.2-klein-base-9B 平均只有 33.87,FLUX.2-dev-32B 仅 48.81,连 30B 参数的模型都不及 GPT-Image-1.5 的 68.96。更关键的是,现有的两类训练范式都解决不了「逐轴正确」问题:监督微调(SFT)学的是「看起来合理的分布」,对每个具体元素是否正确没有保证;而 DPO/GDRO/GRPO 等后训练方法把 Component、Arrow、Text 三个正交维度坍缩成一个标量奖励,模型被惩罚时根本不知道是哪个轴错了,于是「在一个轴上进步」可以悄悄掩盖「在另一个轴上退步」,这正是本文要打破的死结。

本文的目标是本文要构建一个能逐轴保证结构正确性的开源科学图生成框架 SciForma。具体目标包括三件事:(1) 把图质量从「整体好看」改写成 Component / Arrow / Text 三条可独立验证的结构轴,并提供可量化的逐元素清单;(2) 设计一种后训练目标,强制模型「同时」在三轴上正确,并把梯度自动聚焦到最弱的那个轴,而不是用标量奖励平均掉;(3) 用同一套结构清单,让模型在推理时还能自我定位和局部修复残留错误。最终目标是让一个 9B 的开源模型在结构保真度上逼近、甚至部分超越 GPT-Image-1.5 这类商用系统,缩小开源与闭源之间的差距。

与已有工作不同的是,论文的独特切入角度是抓住了「结构保真是联合的而非相加的」这一性质。已有工作要么只关心感知维度(美学、质量),这些维度协变得平滑,标量聚合就够;要么只针对单一符号域(TikZ、SVG、3D 物理合理性)。而科学方法图属于「独立可验证的结构轴在联合约束下」的新场景,单轴失败即整图作废。作者据此做了三件别人没做的事:第一,提出维度锚定的偏好构造,从 $K=12$ 个 rollout 中挑出一个共享赢家 $y^+$ 和 $D$ 个「只在某一轴弱」的输家 $y^-_d$,把失败模式显式隔离;第二,把目标函数从均值 DPO(仍可补偿)换成多路 Bradley–Terry 的联合损失,损失只在所有 $\Delta_d>0$ 时才归零;第三,在推理时把同一个结构清单复用为闭环编辑的判官,形成训练-评估-编辑一致的统一闭环。

核心方法

整体思路先直觉再技术:既然「错一项就全错」,那就不要让模型把三件事一起学,而是把它们拆开、分别挑出「谁在哪条轴上犯了错」,再用一个不可补偿的损失逼它同时修好。技术路线分四步。(1) 数据:从 593K 篇 arXiv LaTeX 源里抽取 656K 生成对和 70K 编辑三元组,并用结构清单做复杂度分层;同时留出 2K 样本做逻辑验证评测 SciFormaBench-2K。(2) SFT:两阶段,先用全量 656K 在 ~768px 上学基本布局、文字、连接,再在高分辨率 ~1024px 上联合训练生成和编辑,得到 SciForma-Base。(3) M-DPO:用 SciForma-Base 滚出候选,按轴构造「维度锚定偏好对」,再用联合损失做偏好优化,得到 SciForma-9B。(4) 推理闭环编辑:用 GPT-5.4 当判官定位缺陷,按 16×16 VAE 网格做局部重绘,并设全局单调守卫 $S_\text{new} \ge S_\text{old} - \epsilon$ 做通过/回滚。整个框架围绕「结构清单」这一单一抽象贯穿数据、训练、评测、推理。

核心创新是把标量奖励替换成「维度锚定 + 联合目标」双重设计,区别有三。第一,样本构造:不像标量 DPO 把输家混成一个梯度方向,M-DPO 每个输家 $y^-_d$ 都是「专门只在轴 $d$ 上弱、其余轴有竞争力」的样本,三轴产生 3 个独立失效模式对照。第二,目标:用多路 Bradley–Terry 导出 $\mathcal{L}_\text{M-DPO}=\log(1+\sum_d \exp(-\beta\Delta_d))$,只在所有 $\Delta_d>0$ 时才趋零,是软化的「逻辑与」约束;均值 DPO 用 $\frac1D\sum_d -\log\sigma(\beta\Delta_d)$ 可补偿,最弱轴梯度被 $1/D$ 稀释。第三,梯度:求导得 $w_d=\frac{\exp(-\beta\Delta_d)}{1+\sum_{d'}\exp(-\beta\Delta_{d'})}$,是关于「性能赤字」的 softmax——模型在哪个轴还偏袒输家($\Delta_d<0$)梯度就集中到哪,无需手工调度;全轴满足时所有 $w_d\to0$,训练自动停止,避免过优化。

方法步骤详情

完整步骤。Step1 数据:从 593K 篇 arXiv 抽 ~1.8M 候选,双 VLM 共识 + pHash 去重得 656K 生成对 + 70K 编辑三元组,并做复杂度分层。Step2 SFT-1:656K 全量 768px 训 140K 步(batch=16, LR=$10^{-5}$)。Step3 SFT-2:244K 高质量 + 70K 编辑在 ~1024px 联合训 90K 步,编辑用潜变量序列拼接 + RoPE 时间偏移只监督 target。Step4 M-DPO 样本:50K prompt 各 rollout $K=12$,Qwen3-VL-8B 三轴打分,选共享赢家 $y^+$ 与每轴输家 $y^-_d$,筛出 ~16K 元组。Step5 优化:4×B200 训 4K 步(LR=$10^{-6}$, $\beta{=}2000$),元组共享同噪声与时间步。Step6 推理闭环:GPT-5.4 按「文字>模块>箭头」定位缺陷、框对齐 16×16 VAE 网格,出 $K{=}3$ 候选,$S_\text{new}<S_\text{old}{-}0.03$ 时回滚。

技术新颖性

技术新颖性体现在三处。其一,首次把「可独立验证的结构轴」与「联合 DPO 目标」配对:CaPO、MCDPO 等同样是多维 DPO,但它们在感知轴(美学)上工作,因为那些轴协变得平缓、可补偿;本文面对的是单轴失败即作废的硬约束,因此必须用联合而非加权的损失——表 6 显示 CaPO/MCDPO 都让 Text 轴倒退(−1.34/−1.85),只有 M-DPO 三轴全升。其二,自适应梯度再加权是损失结构自然涌现的副产物,无需任何手工 schedule,这一点在 Appendix C 有完整推导,并验证了 $D=1$ 时严格退化为标准 DPO,因此 M-DPO 是 DPO 在 $D \ge 2$ 联合场景下的严格推广。其三,把同一套结构清单同时用于数据复杂度分层、评测打分、偏好样本挑选和推理缺陷定位,形成「数据-训练-评测-编辑」四者一致的闭环,这是过去任何单一工作都没做到的;同时本文还首次给出 C–A 轴相关系数 $r<0.02$($p>0.05$)的实证,定量证明了「正交失效模式」的假设,反过来论证了为什么标量 RL 奖励会被系统性稀释。

Overview of SciForma.
Fig. 2: Overview of SciForma.
Overview of the SciFormaData-700K construction.
Fig. 3: Overview of the SciFormaData-700K construction.
M-DPO Algorithm Overview.
Fig. 4: M-DPO Algorithm Overview.
Illustration of structural inventory verification on a generated diagram.
Fig. 12: Illustration of structural inventory verification on a generated diagram.
Anatomy of the Closed-Loop Editor.
Fig. 13: Anatomy of the Closed-Loop Editor.

实验结果

结果分四块。第一,SciFormaBench-2K:SciForma-Base 把底座从 33.87 拉到 67.59,逼近 GPT-Image-1.5 的 68.96;M-DPO 到 69.51 超越之,最大增益在最弱轴 Arrow +1.82、Text +3.16;叠加编辑到 72.40。第二,AIBench:SciForma-9B 70.29 超人类原图 70.09、领先 GPT-Image-1.5 8.67 分,Topology +6.19 over 原图;Component 反低原图。第三,PaperBanana:作 Visualizer 取 30.7% 胜率超 GPT-Image-1.5(19.0%),瓶颈在 Conciseness。第四,用户研究:36 名研究生投票显示 SciForma 全维度胜 Wan2.7-Image、抗衡 Nano Banana Pro,与人类偏好 Pearson $r=0.76$。消融:M-DPO 4K 步 +1.92 远超 SFT 续训 30K 的 +0.37;GDRO/GRPO 不如 SFT;开源 Qwen3-VL 重打分排名几乎一致。

Comparison of diagram benchmarks.
Table 1: Comparison of diagram benchmarks.
SciFormaBench-2K (a) and AIBench (b) leaderboards.
Table 2: SciFormaBench-2K (a) and AIBench (b) leaderboards.
PaperBanana benchmark (292 samples, Gemini-3-Pro judge).
Table 3: PaperBanana benchmark (292 samples, Gemini-3-Pro judge).
Alternative post-training paradigms.
Table 4: Alternative post-training paradigms.
Ablation from scalar DPO to M-DPO on SciFormaBench-2K.
Table 5: Ablation from scalar DPO to M-DPO on SciFormaBench-2K.
Comparison with peer multi-dimensional DPO methods.
Table 6: Comparison with peer multi-dimensional DPO methods.
Detailed ablation of contrastive axes D on SciFormaBench-2K.
Table 15: Detailed ablation of contrastive axes D on SciFormaBench-2K.
Error taxonomy for SciFormaBench-2K evaluation.
Table 8: Error taxonomy for SciFormaBench-2K evaluation.
Training trajectories from the same 90K SFT checkpoint on SciFormaBench-2K (GPT-5.4).
Fig. 5: Training trajectories from the same 90K SFT checkpoint on SciFormaBench-2K (GPT-5.4).
User study. Win/Tie/Lose percentages for SciForma-9B.
Fig. 6: User study. Win/Tie/Lose percentages for SciForma-9B.
Qualitative results of SciForma-9B against open-source and proprietary models.
Fig. 7: Qualitative results of SciForma-9B against open-source and proprietary models.
Visualization of the closed-loop iterative refinement process.
Fig. 8: Visualization of the closed-loop iterative refinement process.
Visual improvements introduced by M-DPO.
Fig. 10: Visual improvements introduced by M-DPO.
查看结构化数据
任务指标本文基线提升
SciFormaBench-2K 结构保真(平均分) Overall 平均分(GPT-5.4 judge, 0–100) SciForma-9B 69.51,+Edit 72.40 GPT-Image-1.5 68.96,FLUX.2-klein-base-9B 33.87 相对最强开源底座 +35.64;首超 GPT-Image-1.5
SciFormaBench-2K Text 轴(最弱轴增益) Text 子分 M-DPO 后 67.00(+3.16) SciForma-Base 63.84;CaPO 62.50(−1.34);MCDPO 61.99(−1.85) 联合损失带来同维度下最大 Text 增益,证明标量/标定法会损害文本
AIBench 视觉逻辑一致性(VQA) Score(0–100,不依赖本文清单) SciForma-9B 70.29;+Edit 70.62 人类原图 70.09;GPT-Image-1.5 61.62 超越人类原图,领先 GPT-Image-1.5 +8.67;Topology +6.19 over 原图
M-DPO vs 续训 SFT(消融) SciFormaBench-2K 平均增益 M-DPO 4K 步 +1.92 SFT 续训 30K 步 +0.37 1/7 训练步数换 ~5× 增益,破除 SFT 平台期
PaperBanana 智能体集成(对人类原图成对胜率) Overall win rate(Gemini-3-Pro judge, %) PaperBanana + SciForma 30.7 PaperBanana + GPT-Image-1.5 19.0;Nano Banana Pro 单独 43.2 作为开源 Visualizer 超过 GPT-Image-1.5,逼近 Nano Banana Pro

局限与改进

作者自陈三处局限:一是 1024px 分辨率限制了对密集图的细粒度渲染,AIBench 上 Component 反低于人类原图(77.53 vs 82.65)是直接证据;二是评测与编辑流水线高度依赖专有 VLM(数据生成用 OpenAI-o3、标注用 Qwen3-VL-8B、编辑判官与主榜用 GPT-5.4),复现和成本都受制约;三是智能体场景下结构清单是自动生成而非人工核验,可能与用户意图漂移。作者在 §H.3 还列三类顽固失效:非水平文字(旋转 y 轴标签)会被糊掉或塌成水平、高密度拓扑里出现幽灵/缺失/错连箭头、编辑 bounding box 不准会截断相邻元素导致局部重绘与全局不协调。我的额外观察:表 2a 显示 SciForma-9B 与 GPT-Image-2(85.62)、Nano Banana Pro(81.34)仍有 ~12–16 分差距,闭源上限尚未触及;编辑用 GPT-5.4 当判官、评测也用 GPT-5.4,存在「自评自改」的循环风险;Hard 子集(62.86)相对 Simple(77.20)掉分明显,说明复杂度越高联合约束越难满足,与「联合正确性」本质吻合。

独立分析的弱点

针对每条弱点给出场景与改进方向。(1) 分辨率瓶颈:1024px 下密集 Component 掉分,改进方向是引入更高分辨率的潜空间训练或多尺度 patch 化推理,FLUX 的 16×16 VAE 网格可平滑扩展到 2048px。(2) 旋转文字失败:根因是底座对非水平文字偏置,改进方向是合成旋转文字训练数据、在 Text 轴加朝向监督,或换用文字渲染更强的底座。(3) 高密度箭头错误:箭头本质是图级拓扑问题,可把箭头当作图边、引入 GNN 校验或图匹配奖励作为额外轴,而非靠局部重绘。(4) 编辑 bounding box 不准:刚性框裁剪会波及邻居,改进方向是用 SAM3 语义分割驱动的 region-aware 而非 box-aware 重绘。(5) Conciseness 弱:扩散模型忠实画下所有元素反输给商用模型的省略能力,可加「信息密度」轴或 LLM 控制的元素选择前置阶段。(6) 自评自改循环:编辑与评测都用 GPT-5.4 存在同源偏差,应引入独立的开源 VLM 评判或对编辑前后做人类抽样校准。

未来方向

作者明确指向三个方向:更高分辨率训练、开源 VLM 评测器、人在环中的智能体框架。除此之外,基于现有成果可延伸:(1) 把 M-DPO 的联合思想推广到其他「单点失败即作废」的逐轴任务,作者在结论中明确呼吁社区这么做;(2) 在 D 上做泛化——本文只验证 $D=3$,可扩展到带公式子项、颜色编码、对齐方式等更多轴,验证联合损失的扩展性;(3) 把结构清单作为可微约束接入在线 RL(GRPO/Neighbor GRPO),看能否进一步逼近 GPT-Image-2 的 85 分;(4) 探索「省略性生成」与「忠实生成」之间的可控权衡,解决 PaperBanana 的 Conciseness 瓶颈;(5) 在防滥用层面,作者主张生成输出必须人在环中核验,未来可研究水印或可溯源标注,防止论文造假。附录 §H.3 也提到三个具体后续:旋转文字数据、图级拓扑约束、分割驱动的区域编辑。

复现评估

复现评估总体较好但有门槛。开源承诺:代码和数据将发布于 github.com/microsoft/SciForma,附录 I 提供数据流水线与评测完整 prompt,附录 A 表 7 给出数据漏斗(593K→1.8M→658K→656K 生成 + 70K 编辑)。评测协议公开:结构清单抽取与三轴判分 prompt、错误分类(表 8)、严重度权重全披露,并提供开源 Qwen3-VL-8B 重打分作交叉验证。训练超参完整:bfloat16、DeepSpeed ZeRO-2、8×B200 做 SFT、4×B200 做 M-DPO,步数、batch、LR、$\beta$、阈值全给出。主要障碍:(1) 算力——B200 级别 8 卡 SFT + 4 卡 M-DPO 对学术组不友好;(2) 依赖闭源 API——数据用 OpenAI-o3、主榜与编辑用 GPT-5.4、智能体评测用 Gemini-3-Pro;(3) 底座 FLUX.2-klein-base-9B 开源可用性需确认。整体属「可部分复现」,重训成本与评测 API 是最大障碍。