WithEveryone:面向群体图像生成的统一规划与身份锚定框架 WithEveryone: Unified Planning and Identity Grounding for Group Image Generation
把身份选择、布局规划与生成统一进一个模型,让5–10人合影既保真又不重脸
前置知识
统一多模态模型(UMM)
指在单一 Transformer 中同时做文本理解和图像生成的架构,典型如 transfusion 风格的 mixture-of-transformers:文本按下一词预测自回归生成,图像隐变量用流匹配学习,两种模态共享同一条因果上下文,生成前的高层决策能直接约束后续图像 token。HunyuanImage 3、BAGEL 属于此类。
WithEveryone 的全部设计都依赖"规划与生成在同一上下文":Layout CoT、ID token、身份表征预测和目标图像在同一条序列里交错,这是分离式 planner+generator 方案做不到的。
流匹配(Flow Matching)
一种生成式训练范式:模型学习速度场 $v_\theta(x_t, t)$,从噪声沿直线路径推进到数据。由于路径线性,可用一步估计重构干净图像 $\hat{x}_{\text{clean}} = x_t - t\,v_\theta(x_t,t)$,使训练中对"当前预测的图像"施加额外损失成为可能。
本文的 LG-ID Loss 正是建立在这个一步估计之上:对 $\hat{x}_{\text{clean}}$ 做 VAE 解码后裁剪人脸区域算身份损失;且因为高噪声下估计无人脸,必须设 $t\le 0.85$ 的时间步阈值。
ArcFace 人脸嵌入
基于加性角度间隔损失训练的人脸识别网络,把每张人脸映射为 512 维归一化向量,余弦相似度接近 1 表示同一个人。它既是身份特征提取器,也是身份比对的标准度量工具,论文中所有身份相似度指标(Sim(Ref)/Sim(Tgt))都基于 ArcFace、FaceNet、AdaFace 三编码器平均。
本文 ID token 的来源(512 维 ArcFace 嵌入过 MLP)、表示强制的监督空间(投影到 ArcFace 空间算余弦损失)、以及 LG-ID Loss 的编码器(冻结 ArcFace)全部是它,不理解嵌入空间就无法理解三条身份相关设计。
输出端身份损失与匹配难题
指在生成图像(而非参考输入)上直接对人脸施加身份监督。已有方法必须先确定"生成的哪张脸属于哪个参考":PuLID 只处理单人,WithAnyone 在生成图像上用匈牙利匹配对人脸嵌入做最优分配,且只演示到两人。训练时的图像是含噪单步估计,多张人脸几乎不可分,匹配近乎随机。
这是本文动机的核心:匹配错误会把一个身份的梯度拉向另一个、让监督互相抵消。理解这个失败模式才能理解为什么 LG-ID Loss 要从布局标注直接读取对应关系。
表示强制(Representation Forcing)
一种训练目标:要求模型在生成最终输出之前,先从已累积的上下文中预测一个中间表征,并对该表征施加对齐损失(如与目标嵌入的余弦损失)。它强迫相关信息在长序列中保持"可寻址",防止生成端注意力稀释掉关键条件。
ID token 只是一个 512 维向量投出的单个连续 token,混在 10–20K token 的序列里很容易被忽略。ID Representation Forcing 让模型在画图之前先"说出"每个目标身份的嵌入方向,形成身份脚手架。
研究动机
现有身份保持生成方法主要面向一到五个参考人物:学术方法 WithAnyone、UMO 分别最多演示四人和三人,即使强大的商业系统 Nano Banana Pro 也最多支持七人。随着参考身份增多,身份相似度被普遍报道会下降,模型倾向于复制粘贴人脸或把不同身份融合成一张脸。更关键的是,输出端身份损失(先前工作已证明是强身份保持的必要成分)无法直接扩展到多人:PuLID 只处理单身份,WithAnyone 用嵌入空间匈牙利匹配恢复"生成人脸↔参考"的对应关系、最多支持两人——训练早期和高噪声时刻,模型预测的五到十张人脸几乎彼此相同,匹配接近任意,每个错误配对都会把一个身份拉向另一个,本应锐化个体的监督信号相互抵消。与此同时,人数增多让成对空间关系复杂度爆炸,一人错位就会传播到整个构图,遮挡、肢体错误和拥挤布局随之出现。
本文的目标是本文目标是在一张语义与视觉连贯的图像中,从五到十个参考身份生成群体合影,并同时解决三个耦合子问题:其一,每个参考身份都要被真实地"生成出来"而非照抄参考图,即在保持高目标场景身份相似度 Sim(Tgt) 的同时压低 Copy-Paste 伪影;其二,每个参考必须绑定到一个具体、不重复的人物和位置,覆盖率(Coverage)要高、重复率(Dup)要低;其三,多人场景的空间与身体关系——谁站哪里、什么姿态、谁与谁互动——需要在生成前显式规划,而不是把规划负担留给图像去噪过程。最终希望建立一个可系统评测的五至十人群体图像生成系统,在身份不重叠的基准上与学术、开源、商业三类系统全面对比。
与已有工作不同的是,本文的独特切入有两条。第一是"移除对应问题而非改进匹配器":以往把身份对应当作匹配问题,在生成的(含噪)图像里做嵌入匹配;本文注意到监督 Layout CoT 的布局标注本身就记载了每个身份的归属,直接按标注区域裁剪预测图与目标图,配对便"按构造正确",从根上绕开匹配失败,使输出端身份监督首次可扩展到五到十人。第二是把规划搬进同一个模型上下文:布局规划此前多由独立规划器完成(LayoutGPT 等),ATLAS、PlanGen 虽统一了规划与生成但只做文本到图像、不含身份;本文把 ATLAS 式规划扩展为身份感知版本——每个规划出的人都绑定到一个参考身份,联合预测人脸区域、身体范围和姿态关键点,再配合把参考组织成"可寻址集合"而非无序池的 ID token 机制,三者协同于同一条 72K token 的因果序列。
核心方法
直觉上,WithEveryone 在画图之前先让同一个模型"想清楚":谁出场(身份选择)、谁站哪(布局与绑定)、每张脸该是什么样(身份表征预测),然后才动手生成。技术上它基于 transfusion 风格的 mixture-of-transformers 统一多模态架构,理解侧与生成侧各 60B 参数,从 HunyuanImage 3.5-preview 初始化:文本与结构化推理自回归预测,目标图像隐变量用流匹配学习,共享因果上下文让生成前的决策直接条件化后续图像 token。生成前模型准备三类条件:(1) 为每个被选中的参考人提取 512 维 ArcFace 嵌入,经轻量 MLP 投影为 ID token 注入序列,使参考成为有地址的集合而非无序池;(2) 自回归预测结构化 Layout CoT(人物索引、边界框、身份-布局绑定、姿态关键点),由确定性渲染器画成条件画布插回上下文;(3) 在目标图像之前为每个身份输出一个表征预测 token(ID Representation Forcing),其隐状态作为身份脚手架供后续图像 token 因果地访问。
核心创新是布局锚定身份损失(LG-ID Loss)。已有输出端身份监督必须先回答"生成的哪张脸属于哪个参考":PuLID 单人无需回答;WithAnyone 用匈牙利匹配在生成图像上恢复对应,但训练时单步估计噪声极大、五到十张脸几乎不可分,匹配接近随机,错误配对使监督互相抵消。本文不再改进匹配器,而是取消匹配本身:由于监督 Layout CoT 的标注已给每个参考身份固定了目标人脸框与关键点,把预测图与目标图在同一标注区域裁剪,配对即按构造正确——无论图里多少人,每个身份都在自己的区域内被独立监督。具体地,先用一步估计 $\hat{x}_{\text{clean}} = x_t - t\,v_\theta(x_t,t)$ 重构干净图像(流匹配天然兼容),VAE 解码后按标注框裁剪、经冻结 ArcFace 编码,损失为逐脸余弦距离 $1-\cos(e_{\text{pred}}, e_{\text{tgt}})$,且仅在 $t\le 0.85$ 时施加(更高噪声下估计不含可识别人脸)。消融证明它是全部组件中单项身份增益最大的来源。
方法步骤详情
训练序列按因果顺序交错七段:(1) 参考图像与用户提示;(2) 自回归输出被选中的参考列表,并为每人载入一个 ID token(512 维 ArcFace 嵌入过 MLP);(3) 结构化 Layout CoT:先输出人脸框与身份-布局绑定,再输出身体框与姿态关键点,坐标用 2,002 个离散 token;(4) 确定性渲染器把计划画成画布(人脸框+贴参考头像+骨架线),插回上下文作条件图;(5) 总结与详细重写描述;(6) 对每个有目标对应的身份,在目标图像前输出表征 token,隐状态经投影头映射到 ArcFace 空间,施加 $\mathcal{L}_{RF}=\frac{1}{M}\sum_i[1-\cos(\hat{e}_i, e_i^{\text{tgt}})]$;(7) 目标图像用流匹配生成。总损失 $\mathcal{L}=\mathcal{L}_{NTP}+1.0\,\mathcal{L}_{FM}+1.0\,\mathcal{L}_{RF}+0.5\,\mathcal{L}_{ID}$。数据由真实合影经人脸检测、YOLOv11 姿态估计与字幕生成构建,共 400K 样本,另有文本到布局语料强化规划。推理时自回归预测选择、CoT 与重写描述,渲染后去噪生成。
技术新颖性
与已有方法的本质区别有三点。第一,输出端身份监督的可扩展性:WithAnyone 的嵌入匹配方案至多两人,LG-ID Loss 把对应关系从"从生成像素里恢复"改为"从布局标注直接读取",首次把输出端身份损失扩展到五到十人,且消融显示它是单一组件中身份增益最大者(P1→P6 的 Sim(Ref) 从 0.339 升至 0.506)。第二,身份感知的统一规划:ATLAS/PlanGen 的 Layout CoT 只规划抽象人物,本文让每个规划的人都携带参考身份索引,与 ID token、表示强制共存于同一条因果序列,实现"规划即绑定"。第三,把表示强制(Wang et al. 2026)适配到身份域:要求模型在合成图像之前先预测每个目标身份的嵌入方向,使身份信息在 10–20K token 的长序列中保持可寻址——第 24 层注意力显示监督位置对对应 ID token 的对角注意力达 0.378–0.574,而对非对应身份仅 0.104–0.121。此外,作者还贡献了把"计划预测"与"计划执行"分离诊断的分析框架(Plan IoU 与 RLS)。
实验结果
在 210 例身份不重叠、五到十人的基准上,WithEveryone 取得最高 Sim(Tgt) 0.499,超过 GPT-Image 2 的 0.462(bootstrap 区间 [+0.027, +0.048],Wilcoxon p=3.8×10⁻¹¹);Sim(Ref) 0.540 仅次于 GPT-Image 2 的 0.583。Copy-Paste 伪影仅 0.055,远低于 GPT-Image 2 的 0.169,说明身份增益并非来自照抄参考脸;Coverage 0.973、Dup 0.028 均为最佳(Seedream 5.0 Pro 为 0.913/0.065)。CLIP-I 0.861 与 Nano Banana 2(0.860)统计不可区分。按人数分层,五到十人的 ArcFace 相似度从 0.629 降到 0.571,GPT-Image 2 从 0.593 降到 0.496、UMO 从 0.412 降到 0.330,退化更平缓。消融显示 LG-ID Loss 是最大单项增益(Sim(Ref) 0.339→0.506、Coverage 0.741→0.947),Layout CoT 主要提升构图(Count 0.771→0.828),完整模型达 0.555/0.461。基线相似度随相对脸宽每增 1% 涨 0.016–0.019,本文近水平(−0.002);Plan IoU 从 0.773 升至 0.814(2K 训练),且换 GT 布局仍显著抬分,说明剩余误差主要在计划质量而非执行。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 五至十人群体图像生成(210 例身份不重叠基准) | Sim(Tgt) ↑(三编码器平均) | 0.499 | GPT-Image 2:0.462 | +0.037,bootstrap 区间 [+0.027, +0.048],Wilcoxon p=3.8e-11 |
| 五至十人群体图像生成 | Copy-Paste ↓ | 0.055 | GPT-Image 2:0.169 | 降低 0.114,身份增益与照抄参考脸脱钩 |
| 五至十人群体图像生成 | Coverage ↑ / Dup ↓ | 0.973 / 0.028 | Seedream 5.0 Pro:0.913 / 0.065;GPT-Image 2:0.905 / 0.075 | 覆盖最高、重复最低,几乎不漏人也不塌缩 |
| 五至十人群体图像生成 | Sim(Ref) ↑ | 0.540 | GPT-Image 2:0.583 | −0.043(第二名,但 Copy-Paste 低得多);单编码器 ArcFace 2K 下 0.614 对 0.566 反超 |
| 消融(1K,ArcFace 协议) | Sim(Ref) ↑ | P7 完整模型 0.555 | P1 默认模型 0.339 | +0.216;其中 LG-ID Loss 单项(P1→P6)+0.167,为最大来源 |
| 消融 | Coverage ↑ | P6(仅 LG-ID)0.947 | P1 默认 0.741 | +0.206,证明身份损失同时携带空间信息 |
局限与改进
作者承认的局限:提示欠约束时多种布局都合理,布局评价困难;评测仅 210 例、单基准,高人数分组样本最少(十人组仅 10 例),分人数结论只能读作趋势;身份指标继承人脸检测与识别器的行为,在不同人口群体上精度有差异;被比系统在分辨率与能否自主规划上不对等。我的补充观察:其一,计划质量是残余瓶颈——换 GT 布局后 Sim(Ref) 从 0.364 升至 0.412、Count 0.828→0.958;其二,表示强制收益小(+0.013/+0.015),注意力证据仅三个样本的第 24 层,缺少与无 RF 模型的对照;其三,完整模型相对 LG-ID-only 的增益混合了额外组件与文本到布局语料,无法归因;其四,1K 下 61% 的人脸小于 ArcFace 的 112px 输入,本文优势集中于小脸(112–150px 带内 0.611 对 0.561),200–260px 带内被 GPT-Image 2 反超(0.616 对 0.654)。
独立分析的弱点
独立分析的弱点与改进方向:(1) 规划质量瓶颈——GT 布局仍是显著上界(P3 对 P2:Sim(Ref) 0.412 对 0.364、Count 0.958 对 0.828),可对规划阶段引入以 RLS 为奖励的强化学习或扩充文本到布局语料来缩小差距;(2) LG-ID Loss 依赖带标注的人脸框与关键点,训练数据必须经过检测+对应标注流水线,难以直接利用无标注网络数据,可用伪标签或自蒸馏放宽此依赖;(3) 时间步阈值 $t\le 0.85$ 是手工设定的硬阈值,边界附近一步估计的可靠性存疑,可改为随噪声水平连续加权的软监督;(4) 表示强制收益小且机制证据薄弱,需与无 RF 的对照模型做注意力对比来确证因果,而非仅展示三个样本的对角注意力;(5) 大脸(200–260px)场景被 GPT-Image 2 反超,而后者的高 Copy-Paste 与其大脸优势可能同源(更接近照抄),如何在低伪影约束下进一步逼近参考外观值得研究;(6) 120B 参数、128 张 H20 GPU 的训练规模令学术机构难以复现,各组件在十亿级小模型上是否仍有效未经验证,限制了方法的外推信心。
未来方向
作者提出的方向:改进布局评价协议(提示欠约束时如何衡量布局质量);部署层面加入被引用人物的同意机制与来源标识(防深伪滥用)。基于本文成果可延伸的:把身份感知 Layout CoT 与 LG-ID Loss 迁移到视频生成,解决多人时序身份一致性这一更难的问题;把"布局标注锚定监督"的思想推广到其他需要逐实例对应关系的属性(服装、表情、视线方向);支持十人以上超大群体与旁观者的自动化处理(当前旁观者以 match=-1 排除在监督之外);让用户在推理时交互式修改预测计划(拖动框、改绑定)再重新渲染生成,实现可控的合影编排;以 RLS 为奖励对规划 token 做 RL 微调;研究小脸(<112px)下的身份监督,例如超分辅助的 ArcFace 监督或分辨率感知的损失加权。
复现评估
完整复现难度很高。模型从内部的 HunyuanImage 3.5-preview 初始化(未开源),主干为理解侧+生成侧各 60B 参数的 mixture-of-transformers;训练数据为 400K 条内部合影样本(未发布);训练用 128 张 H20 GPU、Muon 优化器(生成侧学习率 $1\times10^{-5}$、理解侧 $3\times10^{-6}$)、打包序列 72K token、1600 次迭代。210 例基准的身份不重叠划分未说明是否公开。论文页脚标注了项目页与代码链接,但缺少底座权重与训练数据时无法端到端复现。可行路径是在开源 UMM(如 BAGEL)上实现 LG-ID Loss——公式、权重 0.5、阈值 $t\le0.85$ 均已给出,配合公开的 ArcFace 与 YOLOv11-pose 即可搭建;评测协议(三编码器平均、Copy-Paste 定义、Layout Score 与 RLS 公式)在附录描述得足够详细,可独立重建。
论文图表