← 返回 2026-07-21

HOMIE:基于多模态智能增强的人-物中心化视频个性化框架 HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement

Yiyang Cai, Nan Chen, Rongchang Xie, Junwen Pan, Chunyang Jiang, Cheng Chen, Wen Zhou, Zhenbang Sun, Wei Xue, Wenhan Luo, Yike Guo 📅 2026-07-20 👍 57 2026-07-25 18:30
主体一致性 人-物交互生成 多模态大模型 扩散Transformer 视频个性化

统一处理主体间与主体内参考的HOCVP框架,借助MLLM推理实现SOTA人-物交互视频生成

前置知识

视频扩散模型与DiT(Diffusion Transformer)

视频扩散模型通过逐步去噪从随机噪声生成视频,早期基于U-Net架构,现在主流采用扩散Transformer(DiT)。DiT将视频经3D VAE压缩到紧凑潜空间后,用Transformer在潜空间去噪,相比U-Net在视觉保真度和时序连贯性上更优。本文采用基于DiT的文生视频模型Wan2.1-14B/2.2-14B作为骨干,用流匹配(flow matching)范式训练:学习一个连续速度场$v_\theta$,将噪声样本$z_0$沿确定性轨迹变换到数据分布$z_1$,训练目标为$L_{FM}(\theta)=\mathbb{E}_{t,z_0,z_1}\|v_\theta(z_t,t,c)-(z_1-z_0)\|_2^2$,其中$z_t=(1-t)z_0+tz_1$。

HOMIE的所有创新(GMG、MRE)都建立在DiT骨干的自注意力机制之上,理解DiT的token结构和自注意力运算方式是理解方法如何注入多模态特征的前提。

多模态大语言模型(MLLM)

MLLM是能同时处理图像和文本的大语言模型,如本文使用的Qwen3-VL-2B-Thinking。它接收参考图像和文本提示,输出蕴含丰富视觉-语言语义关联的隐藏状态特征。关键在于MLLM具备推理能力,能理解'某个logo应该贴在哪个物体上'这类抽象概念关联,而不需要显式说明。本文提取MLLM最后一层隐藏状态(最大长度1024,维度2048),作为多模态特征$F_M$指导视频生成。

HOMIE的核心卖点是利用MLLM的推理知识来处理抽象概念个性化(如logo自动关联到正确物体)和主体内关联,理解MLLM能提供何种知识是理解论文动机和方法设计的关键。

主体间与主体内个性化(Inter-/Intra-subject)

本文将HOCVP场景按参考图像结构分为两类:主体间(inter-subject)指所有参考图都是不同主体(一个人加一个物);主体内(intra-subject)指多张参考图对应同一主体,例如同一物体的多视角图(提升多视角一致性)或物体的OCR文字图(提升文本保真度)。区分这两类是HOMIE统一框架的基础,也是MRE模块设计的出发点。

这是本文区别于以往只关注主体间场景工作的核心分类维度,理解主体内参考(OCR图、多视角图)如何增强生成质量是把握论文贡献的前提。

自注意力中的Query-Key调制

在Transformer自注意力中,输入先经线性投影得到查询矩阵Q和键矩阵K,再做注意力运算$\text{softmax}(QK^T/\sqrt{d})V$。HOMIE的GMG机制正是作用于这个Q-K计算阶段:它将MLLM特征对应的全局表示通过仿射变换(缩放加偏移)注入到视频token的$Q_v$和$K_v$中,公式为$\tilde{Q}_v=(1+\gamma_q(\tilde{Q}_M))\times Q_v+\beta_q(\tilde{Q}_M)$,从而在不破坏参考图像原生注意力模式的前提下注入多模态语义。

GMG是本文两大创新之一,其数学操作完全基于自注意力的Q-K机制,理解注意力运算才能理解GMG为何比直接对齐到UmT5更优。

研究动机

以人为中心结合特定物体的视频个性化(HOCVP)是可控视频生成中高价值且实用的研究方向,但现有方法存在两大关键局限。第一,针对主体间个性化,多数方法难以在高主体保真度与准确的人-物交互模式之间取得平衡,随着主体数量增加,常出现复制粘贴伪影和受限的表达力;更严重的是它们缺乏处理logo等抽象参考所需的推理能力,难以将其准确放置到视频中语义最相关的物体上(例如把COSTA咖啡logo自动贴到一次性纸杯上,而提示词中并未明说这种关联)。第二,针对主体内参考(如OCR文字图、多视角输入),现有方法要么缺乏提取语义对应关系的有效机制,要么依赖3D多视角先验的监督,孤立地处理这些组件往往产生冗余输出、保真度提升有限。作者将HOCVP分为基于参考结构的主体间场景和主体内场景,指出两类问题至今未被统一解决。

本文的目标是本文的目标是构建一个统一的HOCVP框架HOMIE,同时且优雅地处理主体间和主体内两类参考输入。具体而言,在主体间设置下,要在多主体场景中兼顾高保真度与精确的人-物交互,并能利用MLLM的推理能力把抽象logo自动关联到语义最相关的物体;在主体内设置下,要能理解OCR文字图与多视角输入之间的潜在语义对应关系,从而分别提升文本保真度和空间多视角一致性。作者希望在保留文生视频骨干模型既有文本可控性的前提下,让MLLM专注于提取参考关系知识,既不牺牲文本编码器的控制力,也不付出高昂的重新对齐代价,最终在视频质量、文本遵循和主体一致性多个指标上达到开源SOTA。

与已有工作不同的是,本文的独特切入角度在于MLLM与视频扩散模型的集成范式选择。作者在Fig.2中总结了三种集成路径:路径(a)将MLLM特征对齐到UmT5文本嵌入空间,这削弱了UmT5已建立的可控性并把MLLM特征塞进受限空间;路径(b)用MLLM直接替换文本编码器并接入DiT,带来巨大重新对齐成本,还分散MLLM对参考关系知识提取的注意力。HOMIE选择路径(c)——保留文本编码器、让MLLM专责提取参考关系,并通过构建视频、参考图像、MLLM token统一多模态输入流来实现跨模态交互。这一'保留+专责'的范式与以往孤立处理主体内/主体间、或硬性替换编码器的方法形成本质区别,是本文能统一两类场景并保持低成本(11K GPU小时)的根本原因。

核心方法

HOMIE的整体思路是把MLLM当作'参考关系知识提取器',让其语义特征以辅助而非替代方式融入生成。技术路线基于DiT文生视频骨干(Wan2.1-14B/2.2-14B),沿用3D VAE压缩视频、UmT5编码文本经交叉注意力注入、流匹配目标$L_{FM}(\theta)=\mathbb{E}\|v_\theta(z_t,t,c)-(z_1-z_0)\|_2^2$。创新在于扩展条件集$c=\{c_{txt},c_{img}\}$:参考图像经3D VAE编码为$F_r$,参考图像与提示送入Qwen3-VL-2B-Thinking提取多模态特征$F_M=\phi(\Phi_M(P_{sys},P,I))$($\phi$为两层MLP对齐网络)。三类token在输入侧拼接$F=[F_v\oplus F_r\oplus F_M]$实现深层交互,其上叠加GMG(在全部40个DiT块的自注意力Q-K阶段注入MLLM全局语义)与MRE(投影前为每类token打上模态与主体身份标记)两个核心模块。

核心创新点在于'保留文本编码器 + 多模态输入侧拼接 + 自注意力内部引导'这一三段式策略,与已有方法的本质区别是MLLM不再替代或硬对齐文本控制通路,而是作为语义知识的辅助注入源。具体而言,GMG(全局多模态引导)选择在自注意力的查询-键计算阶段介入,而非简单地把MLLM特征拼到文本嵌入或替换文本编码器——它先沿时间维度池化得到MLLM查询/键的全局表示$\tilde{Q}_M$、$\tilde{K}_M$,再通过轻量投影网络$\gamma$、$\beta$产生缩放偏移因子,对视频token的$Q_v$、$K_v$做仿射变换($\tilde{Q}_v=(1+\gamma_q(\tilde{Q}_M))\times Q_v+\beta_q(\tilde{Q}_M)$),而参考图像的$Q_r$、$K_r$保持不变。MRE(模态-参考嵌入)则用一个'一劳永逸'的可学习嵌入模块同时标注模态属性与主体身份:相同$m$标注的主体内参考共享同一参考嵌入$RE[m]$以绑定身份,不同主体分配不同嵌入以区分。这种设计让MLLM知识既稳定控制时序维度,又不破坏DiT的原生注意力模式。

方法步骤详情

步骤1——多模态输入构建:给定提示$P$和参考集$I=\{I_n^m\}$(同$m$为主体内参考),参考图经3D VAE得$F_r$,$P_{sys},P,I$送入Qwen3-VL-2B-Thinking经两层MLP得$F_M$,三类token在序列维拼接$F=[F_v\oplus F_r\oplus F_M]$。步骤2——MRE标注:投影进DiT块前按模态$*\in[v,r,M]$加模态嵌入$\bar{F}_*=F_*+ME[Proj(*)]$,再对参考token按身份加参考嵌入$\bar{F}_r^m=\bar{F}_r^m+RE[m]$(总数设为5)。步骤3——GMG引导:在全部40个DiT块自注意力中,投影后把Q、K划分为$\{Q_v,Q_r,Q_M\}$、$\{K_v,K_r,K_M\}$,对$Q_M$、$K_M$沿时间维池化得全局表示,经投影$\gamma_q,\beta_q,\gamma_k,\beta_k$对$Q_v$、$K_v$做仿射变换,$Q_r$、$K_r$保持原样再拼接执行标准注意力。步骤4——三阶段训练:阶段1在30万单主体样本训练3000步($1\times10^{-5}$);阶段2多参考2000步(嵌入固定顺序);阶段3高分辨率720P训练500步($2\times10^{-6}$)。总计约11K A100 GPU小时。

技术新颖性

技术新颖性体现在三点。其一,集成范式上的范式选择:区别于'MLLM对齐UmT5'(Fig.2a,削弱可控性)和'MLLM替换文本编码器'(Fig.2b,UniVideo/VINO需35k/40k步重新对齐),HOMIE走'保留编码器+输入侧拼接'路线(Fig.2c),使MLLM专责提取参考关系,既保持文本控制力又避免高昂重对齐。其二,GMG的'软注入'机制:不在注意力全连接上粗暴拼接多模态特征,而是通过时间维池化的全局表示做仿射调制,专门针对视频token增强、不干扰参考图像原生注意力,保证时序稳定控制,且插入全部40个DiT块。其三,MRE的统一标注设计:用一套可学习嵌入同时完成'模态区分'与'主体内绑定/主体间区分'两件事——以往方法要么无法处理主体内参考,要么依赖3D多视角先验监督,MRE以零额外先验实现OCR图和多视角图的身份绑定。消融实验显示w/o MRE导致OCR Acc从0.452降至0.376,w/o GMG导致Face-Sim从0.786降至0.697,证明两个模块各自不可或缺且互补。

Framework design of MLLM-facilitated video personalization
Fig. 2: Framework design of MLLM-facilitated video personalization
Overview of HOMIE
Fig. 3: Overview of HOMIE

实验结果

逐项分析核心发现。第一,主体间比较(Table 1):HOMIE(Wan2.1)取得Obj-Sim 0.891、DINO-I 0.543(均最高)、GMEScore 0.691、Face-Sim 0.786,全面领先VACE、Phantom、SkyReels-V3、UniVideo、VINO等;OCR准确率0.452相对SkyReels-V3(0.326)提升21.8%。第二,多视角主体内(Table 2):HOMIE(Wan2.1)DINOrec 0.685/DINOacc 0.582均超VACE(0.642/0.551)和SkyReels-V3(0.654/0.558)。第三,消融(Table 3):完整模型GMEScore 0.691/Obj-Sim 0.891,w/o GMG使Face-Sim降至0.697,w/o MRE使OCR Acc暴跌至0.376,'MLLM to UmT5'仅0.675且无法建立logo关联。第四,定性(Fig.4-5):仅HOMIE、Kling、UniVideo能正确放置logo且仅HOMIE忠实渲染细节。第五,用户研究(Fig.7):HOMIE总体64.7%/文本57.9%/主体一致性66.1%大幅领先Kling(8.4%)等。第六,效率(Table 6):HOMIE仅5.5k步/10k A100小时,远低于Phantom(30k小时)。

Quantitative comparison results of HOCVP
Table 1: Quantitative comparison results of HOCVP
Quantitative results of intra-subject HOCVP with multi-view references
Table 2: Quantitative results of intra-subject HOCVP with multi-view references
Ablation study of various designs and components
Table 3: Ablation study of various designs and components
Comparison of training costs
Table 6: Comparison of training costs
Training details across different stages
Table 5: Training details across different stages
Inter-subject qualitative comparison between HOMIE and previous SOTA methods
Fig. 4: Inter-subject qualitative comparison between HOMIE and previous SOTA methods
Qualitative Ablation Studies
Fig. 6: Qualitative Ablation Studies
User study results
Fig. 7: User study results
查看结构化数据
任务指标本文基线提升
主体间HOCVP物体一致性 Obj-Sim(GPT-5.2物体相似度,越高越好) 0.891(Wan2.1-14B)/ 0.877(Wan2.2-14B) UniVideo 0.872,VINO 0.868,VACE 0.828,Phantom 0.774 Obj-Sim列开源最高,相对UniVideo提升约2个百分点
主体内OCR文本保真 OCR Accuracy(归一化Levenshtein相似度,越高越好) 0.452(Wan2.1-14B)/ 0.431(Wan2.2-14B) SkyReels-V3 0.326,VACE 0.371,VINO 0.331 相对SkyReels-V3提升21.8%
主体内多视角一致性 DINOrec / DINOacc(越高越好) 0.685 / 0.582(Wan2.1);0.696 / 0.560(Wan2.2) SkyReels-V3 0.654 / 0.558,VACE 0.642 / 0.551 DINOrec相对SkyReels-V3提升约4.7%
用户研究综合偏好 总体最佳得票率 64.7% Kling 8.4%,SkyReels-V3 10.6%,UniVideo 10.4%,Phantom 5.9% 得票率约为最强基线SkyReels-V3的6倍

局限与改进

作者承认的局限主要有两点:其一,HOMIE建立在Wan-T2V-14B系列骨干之上,不可避免地继承基础模型的局限,例如Wan架构优化为生成约5秒的短视频片段,因此当前框架也受此时长约束(不过所有竞争基线同样受此限制);其二,鉴于HOCVP的生成性质,作者承认存在深度伪造等潜在滥用风险,承诺未来发布将严格执行合规指南。从我自己的观察看,另有几点值得关注:第一,评估数据集是自建的200样本(含140个三参考以上样本),作者表示'稍后发布',目前尚未公开,第三方独立复现评估存在困难;第二,DINO-I指标上UniVideo/VINO(基于HunyuanVideo-13B且替换编码器)虽略高,作者将训练成本差异作为HOMIE的优势论据,但未在同等骨干下公平对比'替换编码器'策略,消融仅对比了'MLLM to UmT5'而非在Wan上完整复现路径(b),'更优集成策略'的结论略显间接;第三,Wan2.2版本的OCR Acc(0.431)和Obj-Sim(0.877)反不如Wan2.1版本(0.452/0.891),说明换新骨干并未全面提升,跨骨干泛化性有待解释。

独立分析的弱点

独立分析的弱点及改进方向如下。第一,抽象概念个性化高度依赖单个MLLM(Qwen3-VL-2B-Thinking)的推理能力且系统提示工程化(Table 4)影响大,缺乏对MLLM选型、提示敏感性的系统研究——改进方向是引入更大MLLM或多模型集成与提示鲁棒性分析。第二,参考嵌入数量硬编码为5且训练阶段2采用'固定顺序'分配,限制了对超过5个主体或任意顺序输入的扩展性——改进方向是设计动态/位置无关的身份编码机制。第三,主体内能力依赖额外标注(OCR图、多视角图需配合高质量分割掩码和跨帧裁剪),自建高质量子集仅2万条,规模化成本高——改进方向是弱监督或自动挖掘主体内参考。第四,消融中w/o GMG的OCR Acc反升至0.430,说明GMG与MRE交互效应复杂,作者未给出清晰分解,存在解释缺口——改进方向是更细粒度的逐指标消融与可视化。第五,当前仅支持约5秒短视频,无法满足长视频人-物交互需求。

未来方向

作者明确提出的未来方向是:将方法论扩展到长视频生成,以拓宽实际应用场景(目前受Wan骨干约5秒限制)。基于成果可延伸的方向包括:第一,将GMG/MRE机制迁移到图像个性化及其他DiT变体(如Sora类长视频模型、可控编辑模型),验证'保留编码器+软注入'范式的通用性;第二,探索更强的抽象概念推理,例如不仅放置logo还能推理复杂场景语义(如把品牌按使用情境动态呈现);第三,结合3D感知或多主体物理交互建模,把主体内多视角一致性推向更强几何一致性;第四,针对参考嵌入的固定数量与顺序限制,研究基于集合置换不变性的身份编码;第五,作者提到与并发工作BrandFusion(多智能体框架放logo)的对比,未来可探索'模型内集成MLLM推理'与'多智能体外挂推理'两种范式的融合与权衡,以及将抽象概念个性化推广到更多模态参考(音频、草图)。在伦理与安全上,未来需结合水印、内容溯源等机制缓解深度伪造风险。

复现评估

复现评估如下。数据方面:训练基于开源的OpenS2V-5M和PhantomData经多步过滤构建(单主体30万、多主体8万、自建高质量2万、720P约4万),可获取;但自建评估集(200个人-物组合,含140个三参考以上样本)作者仅称'稍后发布',目前未公开,是复现评估的主要障碍。模型方面:骨干为开源的Wan2.1/2.2-T2V-14B,MLLM为开源Qwen3-VL-2B-Thinking,关键技术细节(GMG插入全部40个DiT块、参考嵌入数5、两层MLP对齐、系统提示Table 4、三阶段超参Table 5)披露完整。算力方面:总计约11K A100小时(HOMIE-Wan2.1为5.5k步/10k小时),相对Phantom(30k小时)可控,但对一般研究组仍属高门槛。代码/权重:论文未明确承诺开源,仅提供demo网页展示视频样例。评估指标依赖GPT-5.2、CurricularFace、Grounded-SAM-2、DINO-v2等外部工具与API。综合看,方法描述足以重建架构,但完整复现(尤其自建评测集和GPT-5.2打分)有中等偏高难度,建议尽快公开评测集与代码。