Oxygen-TryOn:面向任意品类试穿的时尚原生基础模型 Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On
把试穿重新定义成多参考理解驱动生成,靠数据引擎+CPT-SFT-RL达到任意品类SOTA
前置知识
Virtual Try-On(虚拟试穿)
虚拟试穿指把参考商品(衣服、鞋、包、配饰等)的图像合成到目标人物身上的图像生成任务。传统做法是「mask-based inpainting + warping」:先用解析模型得到人物的去衣掩码,把服装扭曲贴合到身体,再在掩码区域里填充。它强依赖干净平铺的服装图、标准棚拍人物和明确的服装-agnostic mask,难以处理配饰、鞋包和野外照片。
本文的核心创新就是抛弃这套 inpainting 范式,把它重新表述为多参考、理解驱动的生成任务,所以理解旧范式的局限才能体会新方法的价值。
MMDiT(Multimodal Diffusion Transformer)
MMDiT 是一种双流扩散 Transformer,由 MLLM 提供「语义条件 token」、VAE 提供「图像 latent token」、再加噪声 token,三类 token 在同一 Transformer 里互相 attention 并逐步去噪。本文使用的是 16B 参数的 MMDiT,与 Qwen3-VL-8B 解耦:MLLM 负责「这是什么、穿在哪个部位」,MMDiT 负责「高保真合成」。
理解 MMDiT 的双流结构,才能看懂本文怎么用 MRoPE 时间轴来组织可变数量的参考图。
Conditional Flow Matching(条件流匹配)
Flow Matching 是扩散模型的一种训练目标,它回归从噪声 $\epsilon$ 到干净样本 $x_0$ 之间的「速度场」$v=(\epsilon-x_0)$,而不是预测噪声。本文 SFT 用的损失是 $\mathcal{L}_{\text{SFT}}=\mathbb{E}_{x_0,\epsilon,t}[\lVert v_\theta(x_t,t,c)-(\epsilon-x_0)\rVert_2^2]$,其中插值 $x_t=(1-t)x_0+t\epsilon$,$t\in[0,1]$,条件 $c=(T,I_s,R)$ 包含文本指令、主体图和参考图集合。
SFT 阶段是性能跃升的最大功臣(可用率从 67.95%→85.95%),而它的训练目标正是 Flow Matching,必须看懂这条公式才能复现。
GRPO / DiffusionNFT 强化学习范式
Group-Relative Policy Optimization 是一种无需独立 value 网络的 RL 算法:对同一个 prompt 抽一组生成,用组内相对奖励做归一化,让高奖励样本被强化的概率高于低奖励样本。DiffusionNFT 把这套范式适配到扩散模型,让 policy 在去噪轨迹上按组相对奖励优化。本文在此基础上还借鉴了 Flow-GRPO 和 Dynamic-TreeRPO。
RL 阶段是本文第三阶段,负责把 SFT 模型推向「可上线」的细粒度一致性。理解 GRPO 才能看懂混合奖励是怎么把生成行为塑形的。
MRoPE(Multimodal Rotary Position Encoding)
MRoPE 是把 RoPE 推广到多模态序列的位置编码,通常在 (T,H,W) 即时间、高度、宽度三个轴上分别赋予旋转相位。本文只用了 T(时间/序列)轴:把目标区域的去噪 token 和每个参考图的 clean latent 分配到 T 轴上不重叠的区间,让 MMDiT 凭位置就能区分「目标」和「参考1、参考2…」,完全不引入 segment/index/category embedding。
这是本文多参考条件注入的核心设计,决定了模型为何能优雅支持任意数量参考图。
Rubric-guided VLM-as-Judge + 不确定性感知配对奖励模型
「VLM-as-Judge」是用多模态大模型按评分细则(rubric)给生成结果打分,本文用 Gemini 3.1 Pro 对一致性(指令/身份/物品)和视觉质量(自然度/美学/无瑕疵)各拆 3 个 0–10 维度,先组内调和平均、再两维度几何平均。同时训练一个 8B 的 in-house 奖励模型,输出物品/身份/质量三个头,并用「不确定性感知配对排序损失」同时建模奖励均值和方差,应对主观噪声。两路奖励加权融合作为最终标量。
RL 的成败取决于奖励设计,这套混合奖励同时抑制了 VLM-judge 的 reward hacking 和专有奖励模型的盲点,是性能最后那一档提升的关键。
研究动机
现有虚拟试穿方法被三类瓶颈卡死。第一类是品类受限:绝大多数专用模型(IDM-VTON、OOTDiffusion、CatVTON、FitDiT、Leffa、PromptDresser)只能处理单一服装品类(如上装),且必须依赖棚拍干净平铺服装、棚拍模特和 garment-agnostic mask,根本无法支持鞋、包、帽、眼镜、首饰等配饰,更不能自由组合多件物品。第二类是输入受限:很多方法隐式假设参考是 pristine 平铺服装,而真实用户上传的图片往往带复杂背景、甚至是别人正在穿着的「野外照」,现有模型在这种 unconstrained 输入上表现很差。第三类是一致性脆弱:要做到「同时保住人物的身份/体型/背景,又精确还原每件参考物品的纹理、印花、logo」非常难,尤其在多姿态、半身/全身切换时;即便是 Nano Banana Pro、GPT-Image-2、Seedream5 Lite 这类最强的通用编辑大模型,在做单物品试穿时尚可一战,一旦要同时处理多件参考就会在身份漂移、logo 损坏、遮挡错乱上崩盘——而能补上这个差距的目前几乎都是闭源系统。
本文的目标是本文要做一个真正可部署的「any-item、multi-reference」统一试穿基础模型:给定一张目标人物图 $I_s$ 和任意数量 $n$ 的参考物品图 $R=\{I_1,\dots,I_n\}$(参考可以是干净商品图,也可以是别人正在穿的野外照片),再叠加可选的文本编辑指令 $T$,模型要一次性合成出 $I_o=G(I_s,R,T)$,让目标人物「穿着/戴着」所有指定物品。它必须同时满足:覆盖服装、外套、配饰、鞋、包等几乎所有时尚品类;支持全身与半身视角、可变数量参考、自由多物品组合;同时保住人物的细粒度身份(脸/体型/姿态/背景)与每件参考物品的细粒度外观(纹理/印花/logo/结构轮廓);并且能在同一生成 pass 里顺手执行姿势调整等通用编辑指令。作者声称这是第一个在该保真度下交付 any-item、多参考试穿的系统。
与已有工作不同的是,独特的切入角度在于「范式重定义 + 全栈透明」。范式上,作者把试穿从「mask-based inpainting」重新表述为「multi-reference, understanding-driven generation」:模型要推理「这件东西是什么、该穿在哪个部位、怎么处理遮挡和层叠」,而不是机械地在预定义区域里填像素,这套推理先验让它对未见品类和组合有更强的泛化。工程上,作者不像闭源系统那样只放结果,而是把整套 recipe(数据引擎设计、CPT-SFT-RL 三阶段、混合奖励、推理与 prompt enhancer 协议)全部透明披露,给开源社区一条可复现、可审计、可扩展的路径。这与既有的「专有 warping 模型」和「prompt 通用编辑器」两条线都不同,处在两者中间的「fashion-native foundation model」生态位。
核心方法
整体思路可以概括为「以理解为驱动,把试穿当多参考生成来解」。直觉上:人看到一张商品图和一张人物图,会先理解「这件是针织衫,应该穿在上半身」,再去脑补褶皱、阴影、和身体的贴合关系,而不是先抠 mask 再 warp。模型正是模拟这种推理:MLLM 先把「主体图 + 所有参考图 + 文字指令」编码成交错的语义 token,决定哪件物品配哪个身体部位、它们之间的层叠关系;VAE 把所有图像压成 latent token;MMDiT 把语义 token、图像 latent token 和噪声 token 一起送进双流 Transformer 去噪,最终由 VAE decoder 解出穿衣结果。技术路线上,模型基于 JoyAI-Image-Edit 的预训练权重初始化(继承其 MLLM 为 Qwen3-VL-8B-Instruct、VAE 为 Wan-2.1-VAE、生成核心为 16B MMDiT 的架构),再经过 CPT→SFT→RL 三阶段专精化,全部训练数据由自研数据引擎产出。
核心创新有三处,彼此咬合。第一是「多参考条件注入只用 MRoPE 的时间轴」:把目标去噪 token 与每个参考 clean latent 排成单一 token 序列,分配到 T 轴上不重叠区间,刻意不用任何 segment/index/region-type/category embedding 或参考标签 token——物品身份与摆放完全交给语言侧的指令表达(如「Picture 1 的上衣、Picture 2 的鞋」)。这种设计天然支持可变参考数量,并把「物品外观」(VAE token)与「物品语义/摆放」(MLLM token)解耦。第二是「试穿重定义为理解驱动生成」而非 inpainting,模型主动推理层叠、遮挡、物品-人体交互。第三是「混合奖励 RL」:用 in-house try-on reward(8B,物品/身份/质量三头,不确定性感知配对排序损失,10 万对人工标注)与 Gemini 3.1 Pro 的 rubric-guided judge(一致性与视觉质量各拆 3 维,调和+几何平均抑制 reward hacking)加权融合,既监督细粒度一致性又监督指令级质量。这三点共同把试穿从「填像素」拉到「会推理的生成」。
方法步骤详情
完整流程从数据到推理可以拆成几步。① 数据引擎:从电商、开放域时尚、模型合成三类源头抓取 >50M 张原始图,依次做基础过滤(损坏/分辨率<1024p/MD5 去重/不安全)、规则硬过滤(分辨率/宽高比/白边/对比度/锐度/熵/饱和度)、文字水印过滤(VLM+OCR+patch 检测)、人与物品有效性过滤、美学过滤(Aesthetic-Predictor-v2.5、KONIQ、SPAQ、APDD 多模型投票+加权打分,分5档),最终得到 >10M 张高质量图。② 标注:对商品图标品类、可穿戴身体部位、颜色/材质/纹理/设计等属性(207 类映射、58 粗类、151 电商三级类、104 时装风格类);对人物图标可见部位/姿态/视角/性别/年龄/体型/背景,并产出中英双语文本。③ 配对:用 4 条互补流水线(真商品+真人、真商品+合成人、合成商品+合成人、全合成)构造 item-subject-result 三元组,多物品时按身体部位、品类兼容性、物理共存约束采样,避免「两顶帽子同时戴」之类的不合理组合。④ CPT:在通用预训练语料与试穿数据 1∶1 混合上继续预训练,防止漂移又注入领域知识。⑤ SFT:用条件 Flow Matching 目标在高质量三元组上训练 3 个 epoch,batch 128、LR $5\times10^{-6}$、Cosine 调度、BF16、最大序列 8192,并采用动态序列 packing + block-diagonal mask 提升吞吐。⑥ RL:基于 DiffusionNFT+Flow-GRPO+Dynamic-TreeRPO,对每个条件抽一组生成算组相对奖励,混合奖励驱动优化。⑦ 推理:用结构化指令模板「Put the [item_type] from Picture X onto the subject in Picture Y, keeping ...」,可选 prompt enhancer MLLM 重写为规范指令,参考图推荐按「商品图在前、人物参考在后」排序。
技术新颖性
技术新颖性体现在三个层面的「拒绝默认设计」。架构层面,几乎所有多参考生成工作都会加 region/index/category embedding 或专用参考 token,本文反其道而行,只用 MRoPE 时间轴区分目标与参考,靠自然语言指令解决「谁是谁、谁穿哪」——既减少归纳偏置又天然支持任意参考数。任务层面,把试穿从 inpainting/warping 范式整体迁移到理解驱动生成,让模型显式推理层叠/遮挡/交互而非填充像素,这是范式级转变。训练层面,混合奖励里的「rubric-guided Gemini 判官(调和+几何平均)+ 不确定性感知配对排序的 in-house reward」组合,既规避了 VLM-as-judge 常见的「完美复刻物品却无视指令」式 reward hacking,又规避了专用 reward 的盲点,这种「互补融合」是相对单奖励系统的新设计。需要指出的是,单看每个组件(MMDiT、Flow Matching、GRPO、VLM-judge)都有前人工作,本文新颖性主要在「组合方式与任务重定义」,而非全新算法。
实验结果
本文在四个基准上系统评测,结论可以逐表分析。① 标准 academic 基准(Table 2):在 DressCode 与 VITON-HD 上,Oxygen-TryOn 在重评组内全部 paired 指标第一——DressCode FID 1.932 / KID 0.387 / SSIM 0.936 / LPIPS 0.034,VITON-HD FID 3.941 / KID 0.491 / SSIM 0.914 / LPIPS 0.050,明显领先最强重评基线(如 FastFit* 的 DressCode paired FID 3.658)。② TStars-VTON 单物品(Table 3):本文 Overall 9.36,五维全部第一,其中 item fidelity 9.10 大幅领先次优 8.65,且远超 GPT-Image-2 重评的 8.34;专有学术模型(CatVTON、FastFit)虽然身份/背景分高,但 item fidelity 崩到 3.72–4.67。③ TStars-VTON 多物品(Table 4):本文 Overall 8.41 领先,在身份 9.07、背景 9.00、物理合理性 8.57 三维第一,仅在 item fidelity 8.03 略输 Nano Banana Pro 8.50 / Seedream5 Lite 8.49。④ Oxygen-TryOn Bench(Table 5,1000 样本,Cloth-to-Model 与 Model-to-Model 各 500):本文在 10 项指标里拿下 8 项第一,最关键的可直接上线率(Usability Rate)达 Cloth-to-Model 86.79%、Model-to-Model 85.43%,远超最强闭源 GPT-Image-2 的 80.35%/77.58%,更远超开源最优 FLUX.2-dev 的 67.48%/68.43%。⑤ 训练 recipe 消融(Table 6):SFT 是最大跃升(可用率 67.95%→85.95% / 70.18%→80.44%),RL 在其上再提升物品一致性、美学,并把更难的 Model-to-Model 可用率再提 4.99 点。⑥ 人工评测(Table 7,985 样本,9 名标注员):本文 subject consistency 3.7492 与 Overall 3.5502 均第一,仅 item consistency 与 aesthetics 略输 GPT-Image-2。综合来看,单物品全面领先,多物品与最强闭源打平或小胜,并在「可上线率」这一最贴近部署的指标上拉开显著差距。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| DressCode paired 重构保真 | FID ↓ / SSIM ↑ | 1.932 / 0.936 | FastFit* 3.658 / 0.889 | FID 降约47%,SSIM 升 4.7 个千分点,全部 paired 指标第一 |
| VITON-HD paired 重构保真 | FID ↓ / LPIPS ↓ | 3.941 / 0.050 | FastFit* 6.863 / 0.096 | FID 降约43%,LPIPS 减半 |
| TStars-VTON 单物品综合 | Overall ↑(1-10,Gemini judge) | 9.36 | Seedream5 Lite* 8.77 | Overall +0.59,五维全第一,item fidelity 9.10 vs 8.65 |
| TStars-VTON 多物品综合 | Overall ↑ | 8.41 | Seedream5 Lite* 8.19 | Overall +0.22,4/5 维第一;仅 item fidelity 略输 |
| Oxygen-TryOn Bench Cloth-to-Model 可上线率 | Usability Rate (%) | 86.79 | GPT-Image-2 80.35 | +6.44 点,开源最优 FLUX.2-dev 仅 67.48 |
| Oxygen-TryOn Bench Model-to-Model 可上线率 | Usability Rate (%) | 85.43 | GPT-Image-2 77.58 | +7.85 点,开源最优 FLUX.2-dev 仅 68.43 |
| 人工评测整体偏好 | Overall ↑(1-5) | 3.5502 | GPT-Image-2 3.5375 | 险胜,subject consistency 3.7492 第一 |
局限与改进
作者明确承认两类局限。其一是参考数量上限:模型基于预训练最多支持 4 张参考图的基础模型,所以多物品评测也只覆盖 2–4 件参考;5 件以上的密集组合会显著增加物品混淆、漏穿、层叠错乱,作者计划通过扩充高基数多物品数据、增强多参考条件、上更大基座来解决。其二是推理速度:和多数扩散模型一样依赖多步去噪,限制了交互式与大规模部署的吞吐,作者计划发布蒸馏加速版本。除此之外,我观察到的隐含局限还包括:(a) 在多物品 item fidelity 上仍输给最强闭源(Nano Banana Pro 8.50 / Seedream5 Lite 8.49 vs 本文 8.03),作者归因于基座容量与多物品层叠下的细粒度保持难度;(b) 美学维度并非最强——Cloth-to-Model 美学 3.736 略输 GPT-Image-2 的 3.768,Model-to-Model 美学排第三;(c) RL 阶段在 Cloth-to-Model subject consistency 上有微小回退(3.963→3.945),虽被其他维度增益盖过但提示奖励权衡仍未完全平衡;(d) 大量指标依赖 Gemini 3.1 Pro / GPT-5 作为 judge,存在 API 版本漂移导致的可比性问题(作者自己在 Table 3 注释里就承认重评分与原报分差异巨大);(e) 数据引擎高度依赖合成数据,论文未披露合成与真实样本的占比及合成数据可能引入的分布偏置。
独立分析的弱点
独立分析,本文有几个值得改进的弱点。第一,多物品保真度天花板受限基座容量:当参考 ≥4 件时 item fidelity 8.03 落后闭源,改进方向是显式引入「per-item 一致性头」或在 RL 奖励里对每件参考单独打分加权,让 reward 更精细;同时训练时增加高基数多物品样本的比例。第二,参考数量硬上限 4 张:这在真实 OOTD 场景(一整套穿搭常含 6+ 件)下不够用,改进方向是把 MRoPE 区间从「固定切片」改为「动态长度+层级位置编码」,并在数据引擎里专门构造 5–8 件组合。第三,依赖外部大模型当 judge:Gemini 3.1 Pro 与 GPT-5 既贵又会因 API 变动让分数不可复现,改进方向是把 rubric-guided 评测蒸馏进自家 reward 模型,做 self-judge。第四,推理步数多:可结合 consistency model、rectified flow 一步采样或 layer-wise 蒸馏,作者已计划蒸馏版本,可进一步给出步数-质量曲线。第五,跨域鲁棒性仅在定性图里展示(动漫、油画、电影剧照),缺乏定量跨域基准,改进方向是构建专门的 cross-domain try-on 测试集并报告指标。第六,合成数据占比与版权/真实感偏置未量化,建议披露真实/合成比例并评估合成样本对长尾品类的「幻觉风险」。
未来方向
作者明确提出的未来工作有两条:① 扩展到更多参考物品,通过扩充并平衡数据引擎、强化多参考条件、迁移到更大容量基座,让单次生成能从多件参考组装完整穿搭;② 发布蒸馏加速变体,大幅减少采样步数而尽量保持物品与主体一致性,服务交互式与大规模部署。基于本文成果可延伸的方向我认为还包括:(a) 把混合奖励 RL 推广到视频试穿与可编辑视频,处理时序一致性与服装动态;(b) 结合 3D 表征(如 SMPL-X 或 implicit avatar)做几何先验注入,缓解极端姿态下的层叠错误;(c) 把「理解驱动生成」范式迁移到家居软装、汽车配色等其它「多参考组合」场景;(d) 用 in-context few-shot 形式让模型支持「参考人物风格迁移 + 服装迁移」一体化;(e) 把 prompt enhancer 升级为对话式 agent,支持多轮试穿交互与失败自纠。
复现评估
复现评估整体偏中上但仍有缺口。有利因素:作者明确承诺会发布模型权重,并详细披露了数据引擎(三源 + 多阶段过滤 + 207 类标注体系 + 4 条配对流水线)、训练超参(Table 1:FSDP2、batch 128、micro-batch 1、LR $5\times10^{-6}$、Cosine、3 epoch、BF16、max length 8192、Flow Matching 目标 $\mathcal{L}_{\text{SFT}}=\mathbb{E}[\lVert v_\theta(x_t,t,c)-(\epsilon-x_0)\rVert_2^2]$)、RL 范式(DiffusionNFT + Flow-GRPO + Dynamic-TreeRPO + 混合奖励)、推理与 prompt enhancer 协议、以及结构化指令模板(含中英文示例)。不利因素:(1) 基座 JoyAI-Image-Edit 与 Wan-2.1-VAE、Qwen3-VL-8B 的具体继承细节部分依赖外部权重;(2) 数据引擎虽方法透明但 >50M 原始图与 >10M 过滤后数据未公开发布,电商数据涉及版权无法开源,复现者需自建类似规模数据;(3) RL 奖励依赖 Gemini 3.1 Pro(付费 API)和 10 万对人工标注的 in-house reward,后者不公开;(4) 评测大量依赖 GPT-5/Gemini 当 judge,API 版本漂移会导致分数难复现(作者自己承认);(5) 16B MMDiT + 8B MLLM + 8B reward 的训练对算力要求高,普通团队难复现全流程。综合判断:方法与配方可复现,但「完全打平数字」需要相当的数据与算力投入,中等难度。
论文图表
展示 Oxygen-TryOn 在多种真实场景下的高保真任意品类试穿结果,包括把学士帽和毕业袍跨图组合到多个模特身上、把上衣/长裤/手提包/手链/水杯/凉鞋六件套一次穿到模特身上等案例,覆盖半身与全身、多人物目标。
这是论文的「门面图」,一图说明 any-item、multi-reference、跨主体组合三大卖点,是理解论文动机与能力边界的最佳入口。