← 返回 2026-08-21

WithEveryone:面向群体图像生成的统一规划与身份锚定框架 WithEveryone: Unified Planning and Identity Grounding for Group Image Generation

Hengyuan Xu, Qixun Wang, Yiji Cheng, Miles Yang, Zhao Zhong, Wei Cheng, Xingjun Ma, Yu-gang Jiang 📅 2026-08-20 👍 41 2026-08-26 18:30
图像生成 多主体定制 布局规划 统一多模态模型 身份保持生成

把身份选择、布局规划与生成统一进一个模型,让5–10人合影既保真又不重脸

前置知识

统一多模态模型(UMM)

指在单一 Transformer 中同时做文本理解和图像生成的架构,典型如 transfusion 风格的 mixture-of-transformers:文本按下一词预测自回归生成,图像隐变量用流匹配学习,两种模态共享同一条因果上下文,生成前的高层决策能直接约束后续图像 token。HunyuanImage 3、BAGEL 属于此类。

WithEveryone 的全部设计都依赖"规划与生成在同一上下文":Layout CoT、ID token、身份表征预测和目标图像在同一条序列里交错,这是分离式 planner+generator 方案做不到的。

流匹配(Flow Matching)

一种生成式训练范式:模型学习速度场 $v_\theta(x_t, t)$,从噪声沿直线路径推进到数据。由于路径线性,可用一步估计重构干净图像 $\hat{x}_{\text{clean}} = x_t - t\,v_\theta(x_t,t)$,使训练中对"当前预测的图像"施加额外损失成为可能。

本文的 LG-ID Loss 正是建立在这个一步估计之上:对 $\hat{x}_{\text{clean}}$ 做 VAE 解码后裁剪人脸区域算身份损失;且因为高噪声下估计无人脸,必须设 $t\le 0.85$ 的时间步阈值。

ArcFace 人脸嵌入

基于加性角度间隔损失训练的人脸识别网络,把每张人脸映射为 512 维归一化向量,余弦相似度接近 1 表示同一个人。它既是身份特征提取器,也是身份比对的标准度量工具,论文中所有身份相似度指标(Sim(Ref)/Sim(Tgt))都基于 ArcFace、FaceNet、AdaFace 三编码器平均。

本文 ID token 的来源(512 维 ArcFace 嵌入过 MLP)、表示强制的监督空间(投影到 ArcFace 空间算余弦损失)、以及 LG-ID Loss 的编码器(冻结 ArcFace)全部是它,不理解嵌入空间就无法理解三条身份相关设计。

输出端身份损失与匹配难题

指在生成图像(而非参考输入)上直接对人脸施加身份监督。已有方法必须先确定"生成的哪张脸属于哪个参考":PuLID 只处理单人,WithAnyone 在生成图像上用匈牙利匹配对人脸嵌入做最优分配,且只演示到两人。训练时的图像是含噪单步估计,多张人脸几乎不可分,匹配近乎随机。

这是本文动机的核心:匹配错误会把一个身份的梯度拉向另一个、让监督互相抵消。理解这个失败模式才能理解为什么 LG-ID Loss 要从布局标注直接读取对应关系。

表示强制(Representation Forcing)

一种训练目标:要求模型在生成最终输出之前,先从已累积的上下文中预测一个中间表征,并对该表征施加对齐损失(如与目标嵌入的余弦损失)。它强迫相关信息在长序列中保持"可寻址",防止生成端注意力稀释掉关键条件。

ID token 只是一个 512 维向量投出的单个连续 token,混在 10–20K token 的序列里很容易被忽略。ID Representation Forcing 让模型在画图之前先"说出"每个目标身份的嵌入方向,形成身份脚手架。

研究动机

现有身份保持生成方法主要面向一到五个参考人物:学术方法 WithAnyone、UMO 分别最多演示四人和三人,即使强大的商业系统 Nano Banana Pro 也最多支持七人。随着参考身份增多,身份相似度被普遍报道会下降,模型倾向于复制粘贴人脸或把不同身份融合成一张脸。更关键的是,输出端身份损失(先前工作已证明是强身份保持的必要成分)无法直接扩展到多人:PuLID 只处理单身份,WithAnyone 用嵌入空间匈牙利匹配恢复"生成人脸↔参考"的对应关系、最多支持两人——训练早期和高噪声时刻,模型预测的五到十张人脸几乎彼此相同,匹配接近任意,每个错误配对都会把一个身份拉向另一个,本应锐化个体的监督信号相互抵消。与此同时,人数增多让成对空间关系复杂度爆炸,一人错位就会传播到整个构图,遮挡、肢体错误和拥挤布局随之出现。

本文的目标是本文目标是在一张语义与视觉连贯的图像中,从五到十个参考身份生成群体合影,并同时解决三个耦合子问题:其一,每个参考身份都要被真实地"生成出来"而非照抄参考图,即在保持高目标场景身份相似度 Sim(Tgt) 的同时压低 Copy-Paste 伪影;其二,每个参考必须绑定到一个具体、不重复的人物和位置,覆盖率(Coverage)要高、重复率(Dup)要低;其三,多人场景的空间与身体关系——谁站哪里、什么姿态、谁与谁互动——需要在生成前显式规划,而不是把规划负担留给图像去噪过程。最终希望建立一个可系统评测的五至十人群体图像生成系统,在身份不重叠的基准上与学术、开源、商业三类系统全面对比。

与已有工作不同的是,本文的独特切入有两条。第一是"移除对应问题而非改进匹配器":以往把身份对应当作匹配问题,在生成的(含噪)图像里做嵌入匹配;本文注意到监督 Layout CoT 的布局标注本身就记载了每个身份的归属,直接按标注区域裁剪预测图与目标图,配对便"按构造正确",从根上绕开匹配失败,使输出端身份监督首次可扩展到五到十人。第二是把规划搬进同一个模型上下文:布局规划此前多由独立规划器完成(LayoutGPT 等),ATLAS、PlanGen 虽统一了规划与生成但只做文本到图像、不含身份;本文把 ATLAS 式规划扩展为身份感知版本——每个规划出的人都绑定到一个参考身份,联合预测人脸区域、身体范围和姿态关键点,再配合把参考组织成"可寻址集合"而非无序池的 ID token 机制,三者协同于同一条 72K token 的因果序列。

核心方法

直觉上,WithEveryone 在画图之前先让同一个模型"想清楚":谁出场(身份选择)、谁站哪(布局与绑定)、每张脸该是什么样(身份表征预测),然后才动手生成。技术上它基于 transfusion 风格的 mixture-of-transformers 统一多模态架构,理解侧与生成侧各 60B 参数,从 HunyuanImage 3.5-preview 初始化:文本与结构化推理自回归预测,目标图像隐变量用流匹配学习,共享因果上下文让生成前的决策直接条件化后续图像 token。生成前模型准备三类条件:(1) 为每个被选中的参考人提取 512 维 ArcFace 嵌入,经轻量 MLP 投影为 ID token 注入序列,使参考成为有地址的集合而非无序池;(2) 自回归预测结构化 Layout CoT(人物索引、边界框、身份-布局绑定、姿态关键点),由确定性渲染器画成条件画布插回上下文;(3) 在目标图像之前为每个身份输出一个表征预测 token(ID Representation Forcing),其隐状态作为身份脚手架供后续图像 token 因果地访问。

核心创新是布局锚定身份损失(LG-ID Loss)。已有输出端身份监督必须先回答"生成的哪张脸属于哪个参考":PuLID 单人无需回答;WithAnyone 用匈牙利匹配在生成图像上恢复对应,但训练时单步估计噪声极大、五到十张脸几乎不可分,匹配接近随机,错误配对使监督互相抵消。本文不再改进匹配器,而是取消匹配本身:由于监督 Layout CoT 的标注已给每个参考身份固定了目标人脸框与关键点,把预测图与目标图在同一标注区域裁剪,配对即按构造正确——无论图里多少人,每个身份都在自己的区域内被独立监督。具体地,先用一步估计 $\hat{x}_{\text{clean}} = x_t - t\,v_\theta(x_t,t)$ 重构干净图像(流匹配天然兼容),VAE 解码后按标注框裁剪、经冻结 ArcFace 编码,损失为逐脸余弦距离 $1-\cos(e_{\text{pred}}, e_{\text{tgt}})$,且仅在 $t\le 0.85$ 时施加(更高噪声下估计不含可识别人脸)。消融证明它是全部组件中单项身份增益最大的来源。

方法步骤详情

训练序列按因果顺序交错七段:(1) 参考图像与用户提示;(2) 自回归输出被选中的参考列表,并为每人载入一个 ID token(512 维 ArcFace 嵌入过 MLP);(3) 结构化 Layout CoT:先输出人脸框与身份-布局绑定,再输出身体框与姿态关键点,坐标用 2,002 个离散 token;(4) 确定性渲染器把计划画成画布(人脸框+贴参考头像+骨架线),插回上下文作条件图;(5) 总结与详细重写描述;(6) 对每个有目标对应的身份,在目标图像前输出表征 token,隐状态经投影头映射到 ArcFace 空间,施加 $\mathcal{L}_{RF}=\frac{1}{M}\sum_i[1-\cos(\hat{e}_i, e_i^{\text{tgt}})]$;(7) 目标图像用流匹配生成。总损失 $\mathcal{L}=\mathcal{L}_{NTP}+1.0\,\mathcal{L}_{FM}+1.0\,\mathcal{L}_{RF}+0.5\,\mathcal{L}_{ID}$。数据由真实合影经人脸检测、YOLOv11 姿态估计与字幕生成构建,共 400K 样本,另有文本到布局语料强化规划。推理时自回归预测选择、CoT 与重写描述,渲染后去噪生成。

技术新颖性

与已有方法的本质区别有三点。第一,输出端身份监督的可扩展性:WithAnyone 的嵌入匹配方案至多两人,LG-ID Loss 把对应关系从"从生成像素里恢复"改为"从布局标注直接读取",首次把输出端身份损失扩展到五到十人,且消融显示它是单一组件中身份增益最大者(P1→P6 的 Sim(Ref) 从 0.339 升至 0.506)。第二,身份感知的统一规划:ATLAS/PlanGen 的 Layout CoT 只规划抽象人物,本文让每个规划的人都携带参考身份索引,与 ID token、表示强制共存于同一条因果序列,实现"规划即绑定"。第三,把表示强制(Wang et al. 2026)适配到身份域:要求模型在合成图像之前先预测每个目标身份的嵌入方向,使身份信息在 10–20K token 的长序列中保持可寻址——第 24 层注意力显示监督位置对对应 ID token 的对角注意力达 0.378–0.574,而对非对应身份仅 0.104–0.121。此外,作者还贡献了把"计划预测"与"计划执行"分离诊断的分析框架(Plan IoU 与 RLS)。

Overview of WithEveryone. WithEveryone generates coherent group images from five to ten reference identities...
Figure 1: Overview of WithEveryone. WithEveryone generates coherent group images from five to ten reference identities...
Overview of WithEveryone. The model loads selected reference identities as ID tokens, predicts structured Layout CoT, renders a visual layout condition, and predicts identity representations before generating the target group image.
Figure 3: Overview of WithEveryone. The model loads selected reference identities as ID tokens, predicts structured Layout CoT, renders a visual layout condition, and predicts identity representations before generating the target group image.
Data statistics, pipeline, and example. ...The corpus contains 400K group-image samples, and the reference-count distribution covers the five-to-ten-person range used at evaluation time.
Figure 4: Data statistics, pipeline, and example. ...The corpus contains 400K group-image samples, and the reference-count distribution covers the five-to-ten-person range used at evaluation time.
Training-time one-step prediction and its outputs under different sampled timesteps. We use t = 0.85 as the timestep threshold and compute the LG-ID Loss only when t ≤ 0.85.
Figure 14: Training-time one-step prediction and its outputs under different sampled timesteps. We use t = 0.85 as the timestep threshold and compute the LG-ID Loss only when t ≤ 0.85.

实验结果

在 210 例身份不重叠、五到十人的基准上,WithEveryone 取得最高 Sim(Tgt) 0.499,超过 GPT-Image 2 的 0.462(bootstrap 区间 [+0.027, +0.048],Wilcoxon p=3.8×10⁻¹¹);Sim(Ref) 0.540 仅次于 GPT-Image 2 的 0.583。Copy-Paste 伪影仅 0.055,远低于 GPT-Image 2 的 0.169,说明身份增益并非来自照抄参考脸;Coverage 0.973、Dup 0.028 均为最佳(Seedream 5.0 Pro 为 0.913/0.065)。CLIP-I 0.861 与 Nano Banana 2(0.860)统计不可区分。按人数分层,五到十人的 ArcFace 相似度从 0.629 降到 0.571,GPT-Image 2 从 0.593 降到 0.496、UMO 从 0.412 降到 0.330,退化更平缓。消融显示 LG-ID Loss 是最大单项增益(Sim(Ref) 0.339→0.506、Coverage 0.741→0.947),Layout CoT 主要提升构图(Count 0.771→0.828),完整模型达 0.555/0.461。基线相似度随相对脸宽每增 1% 涨 0.016–0.019,本文近水平(−0.002);Plan IoU 从 0.773 升至 0.814(2K 训练),且换 GT 布局仍显著抬分,说明剩余误差主要在计划质量而非执行。

Quantitative comparison on our 5–10-person benchmark.
Table 1: Quantitative comparison on our 5–10-person benchmark.
Ablation results. The rows form three incremental branches from the same base: layout (P1–P3), ID token and Representation Forcing (P1, P4, P5), and LG-ID Loss (P1, P6); P7 is the complete configuration.
Table 2: Ablation results. The rows form three incremental branches from the same base: layout (P1–P3), ID token and Representation Forcing (P1, P4, P5), and LG-ID Loss (P1, P6); P7 is the complete configuration.
Dispersion of the main comparison. Per-example means on the 210 benchmark examples with their standard errors.
Table 3: Dispersion of the main comparison. Per-example means on the 210 benchmark examples with their standard errors.
High-resolution comparison. The first two rows use the same internal pipeline; the last row uses the main 2K benchmark pipeline.
Table 4: High-resolution comparison. The first two rows use the same internal pipeline; the last row uses the main 2K benchmark pipeline.
Effect of the LG-ID Loss. It gives the largest individual identity gain while preserving or improving all reported layout measures.
Table 5: Effect of the LG-ID Loss. It gives the largest individual identity gain while preserving or improving all reported layout measures.
Group images generated by WithEveryone. The samples cover different group sizes, scene types, and visual styles.
Figure 2: Group images generated by WithEveryone. The samples cover different group sizes, scene types, and visual styles.
Scaling to more references. Lines show mean ArcFace similarity to the references; distributions are shown for WithEveryone and GPT-Image 2.
Figure 5: Scaling to more references. Lines show mean ArcFace similarity to the references; distributions are shown for WithEveryone and GPT-Image 2.
Qualitative comparison with proprietary models.
Figure 6: Qualitative comparison with proprietary models.
Identity similarity against face size. Curves are local means with 95% confidence bands, annotated with the fitted slope.
Figure 7: Identity similarity against face size. Curves are local means with 95% confidence bands, annotated with the fitted slope.
Plan IoU convergence. The model rapidly converges to follow the planned layout.
Figure 8: Plan IoU convergence. The model rapidly converges to follow the planned layout.
Attention at Representation Forcing prediction positions.
Figure 9: Attention at Representation Forcing prediction positions.
High-resolution training. We compare the Full model trained at 1K and 2K while evaluating both at 1K.
Figure 12: High-resolution training. We compare the Full model trained at 1K and 2K while evaluating both at 1K.
Representation Forcing convergence. The supervised identity prediction is steadily optimized during training and becomes increasingly aligned with both the target and reference identity embeddings.
Figure 13: Representation Forcing convergence. The supervised identity prediction is steadily optimized during training and becomes increasingly aligned with both the target and reference identity embeddings.
LG-ID Loss weight ablation. Increasing λID substantially improves Sim(Ref), whereas Layout Score and RLS remain in the same range without a stable ordering across weights.
Figure 15: LG-ID Loss weight ablation. Increasing λID substantially improves Sim(Ref), whereas Layout Score and RLS remain in the same range without a stable ordering across weights.
查看结构化数据
任务指标本文基线提升
五至十人群体图像生成(210 例身份不重叠基准) Sim(Tgt) ↑(三编码器平均) 0.499 GPT-Image 2:0.462 +0.037,bootstrap 区间 [+0.027, +0.048],Wilcoxon p=3.8e-11
五至十人群体图像生成 Copy-Paste ↓ 0.055 GPT-Image 2:0.169 降低 0.114,身份增益与照抄参考脸脱钩
五至十人群体图像生成 Coverage ↑ / Dup ↓ 0.973 / 0.028 Seedream 5.0 Pro:0.913 / 0.065;GPT-Image 2:0.905 / 0.075 覆盖最高、重复最低,几乎不漏人也不塌缩
五至十人群体图像生成 Sim(Ref) ↑ 0.540 GPT-Image 2:0.583 −0.043(第二名,但 Copy-Paste 低得多);单编码器 ArcFace 2K 下 0.614 对 0.566 反超
消融(1K,ArcFace 协议) Sim(Ref) ↑ P7 完整模型 0.555 P1 默认模型 0.339 +0.216;其中 LG-ID Loss 单项(P1→P6)+0.167,为最大来源
消融 Coverage ↑ P6(仅 LG-ID)0.947 P1 默认 0.741 +0.206,证明身份损失同时携带空间信息

局限与改进

作者承认的局限:提示欠约束时多种布局都合理,布局评价困难;评测仅 210 例、单基准,高人数分组样本最少(十人组仅 10 例),分人数结论只能读作趋势;身份指标继承人脸检测与识别器的行为,在不同人口群体上精度有差异;被比系统在分辨率与能否自主规划上不对等。我的补充观察:其一,计划质量是残余瓶颈——换 GT 布局后 Sim(Ref) 从 0.364 升至 0.412、Count 0.828→0.958;其二,表示强制收益小(+0.013/+0.015),注意力证据仅三个样本的第 24 层,缺少与无 RF 模型的对照;其三,完整模型相对 LG-ID-only 的增益混合了额外组件与文本到布局语料,无法归因;其四,1K 下 61% 的人脸小于 ArcFace 的 112px 输入,本文优势集中于小脸(112–150px 带内 0.611 对 0.561),200–260px 带内被 GPT-Image 2 反超(0.616 对 0.654)。

独立分析的弱点

独立分析的弱点与改进方向:(1) 规划质量瓶颈——GT 布局仍是显著上界(P3 对 P2:Sim(Ref) 0.412 对 0.364、Count 0.958 对 0.828),可对规划阶段引入以 RLS 为奖励的强化学习或扩充文本到布局语料来缩小差距;(2) LG-ID Loss 依赖带标注的人脸框与关键点,训练数据必须经过检测+对应标注流水线,难以直接利用无标注网络数据,可用伪标签或自蒸馏放宽此依赖;(3) 时间步阈值 $t\le 0.85$ 是手工设定的硬阈值,边界附近一步估计的可靠性存疑,可改为随噪声水平连续加权的软监督;(4) 表示强制收益小且机制证据薄弱,需与无 RF 的对照模型做注意力对比来确证因果,而非仅展示三个样本的对角注意力;(5) 大脸(200–260px)场景被 GPT-Image 2 反超,而后者的高 Copy-Paste 与其大脸优势可能同源(更接近照抄),如何在低伪影约束下进一步逼近参考外观值得研究;(6) 120B 参数、128 张 H20 GPU 的训练规模令学术机构难以复现,各组件在十亿级小模型上是否仍有效未经验证,限制了方法的外推信心。

未来方向

作者提出的方向:改进布局评价协议(提示欠约束时如何衡量布局质量);部署层面加入被引用人物的同意机制与来源标识(防深伪滥用)。基于本文成果可延伸的:把身份感知 Layout CoT 与 LG-ID Loss 迁移到视频生成,解决多人时序身份一致性这一更难的问题;把"布局标注锚定监督"的思想推广到其他需要逐实例对应关系的属性(服装、表情、视线方向);支持十人以上超大群体与旁观者的自动化处理(当前旁观者以 match=-1 排除在监督之外);让用户在推理时交互式修改预测计划(拖动框、改绑定)再重新渲染生成,实现可控的合影编排;以 RLS 为奖励对规划 token 做 RL 微调;研究小脸(<112px)下的身份监督,例如超分辅助的 ArcFace 监督或分辨率感知的损失加权。

复现评估

完整复现难度很高。模型从内部的 HunyuanImage 3.5-preview 初始化(未开源),主干为理解侧+生成侧各 60B 参数的 mixture-of-transformers;训练数据为 400K 条内部合影样本(未发布);训练用 128 张 H20 GPU、Muon 优化器(生成侧学习率 $1\times10^{-5}$、理解侧 $3\times10^{-6}$)、打包序列 72K token、1600 次迭代。210 例基准的身份不重叠划分未说明是否公开。论文页脚标注了项目页与代码链接,但缺少底座权重与训练数据时无法端到端复现。可行路径是在开源 UMM(如 BAGEL)上实现 LG-ID Loss——公式、权重 0.5、阈值 $t\le0.85$ 均已给出,配合公开的 ArcFace 与 YOLOv11-pose 即可搭建;评测协议(三编码器平均、Copy-Paste 定义、Layout Score 与 RLS 公式)在附录描述得足够详细,可独立重建。