抖音多模态嵌入模型技术报告 Douyin Multimodal Embedding Model Technical Report
两阶段训练兼顾十亿级检索效率与细粒度语义判别
前置知识
对比学习(Contrastive Learning)
一种通过拉近正样本对、推远负样本对来学习表示的方法。典型代表 CLIP/ALIGN 用大规模图文配对训练,使图像和文本映射到同一向量空间。损失函数常为 InfoNCE 形式 $\mathcal{L}=-\log\frac{\exp(s(q,d^+)/\tau)}{\exp(s(q,d^+)/\tau)+\sum_{d^-}\exp(s(q,d^-)/\tau)}$,其中 $\tau$ 是温度。
DME 的 Stage 1 全靠对比学习建立跨模态统一嵌入空间,理解对比目标为什么只能给出 pair 级粗粒度监督,是看懂本文 Stage 2 为何要补强语义充分性的前提。
双编码器检索(Bi-encoder Retrieval)
查询和文档各自独立编码成稠密向量 $z_q$、$z_d$,再以点积或余弦相似度打分 $s=z_q^\top z_d$。文档向量可离线预计算并存入 ANN 索引,在线只需一次 query 编码,适合十亿级规模。与之对立的是交叉编码器(cross-encoder),需对每个 query-doc 对做联合注意力,精度高但无法离线编码。
DME 的全部设计都围绕'保持双编码器接口'这一约束展开:隐式推理 token 必须留在单次前向传播内,跨条件重建只在训练时用,否则会破坏工业部署的稠密向量检索范式。
多模态大语言模型(MLLM)
在 LLM 基础上接入视觉编码器(如 ViT),把图像、视频帧、视觉文档统一成 token 序列喂给语言模型解码,具备指令跟随、长上下文、多模态推理能力。DME 以 Qwen3.5 这类生成式 MLLM 为骨干,通过提取检索 token 的隐藏状态把它改造成稠密检索器。
本文核心张力正是'MLLM 有强感知与推理潜力,却被当作纯编码器用 pair 级相似度监督优化',理解 MLLM 的生成式能力如何被对比训练'浪费',才能理解 Stage 2 为何要重新注入生成监督。
思维链推理(Chain-of-Thought, CoT)
让模型在给出答案前先生成显式的中间推理文本(rationale),逐步分解问题。CoT 能显著提升复杂推理任务表现,但生成过程是自回归的、高延迟。Think-Then-Embed、UME-R1 等工作把 CoT 引入检索表示,但需在线生成推理链。
DME 的关键创新是把 CoT 蒸馏进隐空间(latent reasoning),用少量 typed latent token 完成定位、对齐、拒绝等推理步骤,既拿到推理收益又避免显式生成的高延迟,这正是它与 CoT 类基线(IFM-TTE、TTE-v2)的本质区别。
下一词预测与多词预测(NTP/MTP)
NTP 是 LLM 最基础训练目标,最大化 $P(x_t|x_{<t})$。MTP 由 DeepSeek 提出,在每个位置额外预测未来 $D$ 个 token,用 $D$ 个轻量模块预测第 $t+k$ 个 token,迫使隐表示做更长程的规划,提升表征质量。DME 把两者用作'嵌入作为解码瓶颈'的监督信号。
Stage 2-B 的 Cross-Conditional Reconstruction 用查询向量重建文档文本、用文档向量重建查询文本,NTP 保证逐 token 精度,MTP 防止嵌入只记忆表面短程线索,二者共同保证嵌入是 information-complete 的。
困难负样本(Hard Negatives)
与正样本共享全局场景或主题、仅在局部区域/关键帧/文本片段/细微语义条件上不同的负样本。它们对对比学习最具信息量,因为能逼迫模型学到细粒度判别力,而非依赖粗粒度类别匹配。本文用检索挖掘、标注干扰项、同任务族相似样本构造困难负样本。
工业检索中大量困难负样本只差一个局部细节,对比监督却无法告诉模型'看哪里',这正是 DME 引入 anchor 证据定位和 reject_neg 隐状态的直接动机。
研究动机
在抖音、小红书、YouTube 这类十亿级规模的视觉内容平台上,多模态检索面临两难。一方面,现有 MLLM 嵌入模型普遍采用对比学习训练,它的监督是 pair 级的——只告诉模型'哪个 query 和哪个 doc 应该靠近',却不说'为什么相关''哪些局部证据支持这个判断''嵌入里该保留哪些细粒度信息'。在真实场景中,用户查询常带多重约束(对象、属性、动作、OCR 文本、时序、空间关系),而困难负样本往往和正样本共享同一全局场景,仅在一个小视觉区域、一帧关键画面、一段文本片段或一个细微语义条件上不同。另一方面,最近一批 CoT 类推理增强检索器(Think-Then-Embed、UME-R1、Embed-RL)虽然能提升细粒度判别,但依赖显式文本推理链或 cross-encoder 重排序,延迟高、无法作为十亿级主检索编码器在线服务。两条路线都无法同时满足'十亿级索引下的效率'与'困难匹配的细粒度语义判别'这两个工业刚需。
本文的目标是DME 的目标是设计一个能在抖音级工业检索系统中作为主稠密检索编码器的多模态嵌入模型,必须同时满足三个硬约束:(1)保持标准双编码器稠密向量接口,文档侧离线编码、查询侧单次前向,不引入显式文本生成、agent 工具调用或 cross-encoder 重排序;(2)让嵌入具备'语义充分性'(semantic sufficiency)——即嵌入既要基于检索相关证据形成,又要保留足够的匹配对端细粒度语义以区分困难负样本;(3)整套能力只带来边际级查询延迟开销。为此 DME 采用两阶段训练:Stage 1 用 25M 对大规模对比预训练建立跨模态统一嵌入空间,Stage 2 在 5M 高质量样本上用两个互补机制补强语义充分性,最终在 MMEB-v2 上 2B/9B 分别取得 74.8/78.4,并在抖音离线评测拿到 2.92% 相对提升。
与已有工作不同的是,本文的独特切入角度是把'推理能力能否从自由文本生成迁移进匹配用的稠密表示'这一开放问题,重新拆解为两个可独立优化的子目标,并分别用'几乎零推理开销'的手段实现。它不再纠结于'要不要在线生成 CoT',而是提出:推理可以折叠进 encoder 内部的少量 typed latent token(evidence localization → typed latent states → embedding readout 的紧凑回路),而对端语义保留可以通过'把嵌入本身当作解码瓶颈'的训练期重建目标来强制——重建分支推理时丢弃,纯训练时监督。这种'推理隐式化、重建训练化'的组合,是它与既有 CoT 检索器和纯对比嵌入器的本质差异,也是它能在保持双编码器延迟的同时逼近甚至超过 CoT 类基线的关键。
核心方法
DME 的整体思路是'先建空间,再补语义'。直觉上,一个'语义充分'的检索嵌入应当满足两条:它是由检索相关证据组装出来的(怎么形成),并且它保留了足够多的匹配对端细节(保留了什么)。技术路线由此分两阶段。Stage 1 把生成式 MLLM 骨干(Qwen3.5)当作标准双编码器,在序列末尾追加一个检索专用 token $\langle emb\rangle$,取其末层隐藏态 $r^{(1)}=h_{\langle emb\rangle}$ 经投影矩阵 $W_{emb}$ 和 $\ell_2$ 归一化得到嵌入,用 InfoNCE 对比损失在文本/图像/视频/视觉文档/混合模态共 25M 对数据上预训练,建立统一几何。Stage 2 在 5M 高质量样本上联合优化对比损失 $\mathcal{L}^{S2}_{CL}$ 与语义充分性损失,后者分两支:Stage 2-A 用证据锚定 + typed latent 推理改造嵌入的'形成方式',Stage 2-B 用 NTP/MTP 跨条件重建约束嵌入'必须保留的内容'。两者目标函数叠加 $\mathcal{L}_{S2}=\mathcal{L}^{S2}_{CL}+\mathcal{L}_{S2A}+\mathcal{L}_{S2B}$,推理时 2-B 完全丢弃、2-A 的 latent token 保留在单次前向内,整体仍是稠密双编码器。
核心创新是把'证据定位—隐式推理—嵌入读出'这条原本属于 CoT 检索器的链路压缩进 encoder 的少量可学习 token,同时把'对端语义保留'从结果评测指标升级为训练期的生成式瓶颈监督。与 VLM2Vec 等纯对比嵌入器的本质区别在于:DME 不再让模型只学'谁该靠近',而是用 anchor token $a_{s,r}$ 通过探针投影 $W_{aq}, W_{ak}$ 对同模态内容 token 做缩放点积注意力 $p_{s,r}(j)=\mathrm{softmax}_{j\in I_m(r)(s)}\frac{(W_{aq}a_{s,r})^\top(W_{ak}x_{s,j})}{\sqrt{d_a}}$ 显式定位证据,并用 typed latent state 把'定位/正对齐/负拒绝/总结'四种检索角色编码进隐藏状态;与 CoT 类基线的本质区别在于:这些 latent token 不解码成文本,终端状态 $h^{traj}_{q,R}$ 直接与池化证据 $e_{q,pool}$ 融合 $r_q=h^{traj}_{q,R}+\alpha\,\mathrm{sg}(W_e e_{q,pool})$ 作为读出。Stage 2-B 进一步把嵌入 $\tilde{z}_q=W_{emb}r_q$ 作为唯一前缀 token 喂回骨干做条件解码,使任何重建所需信息都被迫穿过嵌入向量,从而把'嵌入是否充分'变成了可计算的问题。
方法步骤详情
完整训练分五步。第一步数据与监督构建:Stage 1 聚合公开文本检索/QA、图文、视频文本语料加自研长文本、合成图文、长视频字幕,共约 25M (query, positive) 对,只用 in-batch 负样本并做任务感知分组避免跨模态平凡负样本;Stage 2 用 MMEB-v2 训练集加多源多模态检索数据约 5M 例,含标注/检索挖掘/同族相似困难负样本。第二步用 Seed-2.0-Pro 作教师,对每个 query-positive(可选 hard negative)三元组生成结构化 anchor 记录(文本片段/图像区域/视频帧引用 + 本地摘要)和 typed 轨迹(localize/align_pos/reject_neg/summarize 四种角色,每步含角色、引用证据 id、状态描述),离线缓存成语义目标。第三步 Stage 1 对比预训练,每个 query/doc 经 $z_s=\mathrm{norm}(W_{emb}r)$ 得到 $\ell_2$ 归一化向量,按式 (14) 优化 InfoNCE,温度 $\tau_{CL}$。第四步 Stage 2-A:对 query/doc 输入插入模态感知 anchor token,由教师证据目标经 softmin 分配(式 35)和平衡正则 $\mathcal{L}_{bal}$ 监督命中损失 $\mathcal{L}_{hit}$;anchor 加权池化得 $e_{s,pool}$,由缓存摘要嵌入做余弦监督 $\mathcal{L}_{sum}$;query 侧 typed latent state 分别用 $\mathcal{L}_{sem}$(对齐缓存状态嵌入)、$\mathcal{L}_{align}$(从正样本库中检索出对应正样本)、$\mathcal{L}_{reject}$(margin ranking,margin $\mu$)监督,合并为 $\mathcal{L}_{S2A}=\lambda_{hit}\mathcal{L}_{hit}+\lambda_{sum}\mathcal{L}_{sum}+\mathcal{L}_{typed}$。第五步 Stage 2-B:以 $\tilde{z}_q, \tilde{z}_d$ 为前缀,在共享骨干上做 Q→D 与 D→Q 双向 NTP(式 24-25)和 $D$ 层 MTP(每层一个 Transformer 块 + 投影 $M_k$,式 26-28),合并 $\mathcal{L}_{S2B}=\lambda_{NTP}(\cdot)+\lambda_{MTP}(\cdot)$。推理时丢弃 2-B 全部分支与 $D$ 个 MTP 模块,仅 query 侧保留少量 anchor/latent token,输出标准稠密向量经 ANN 检索 TopK。
技术新颖性
技术新颖性体现在四点。其一,'语义充分性'被首次形式化为可分解的双目标(怎么形成 + 保留了什么),并各自映射到一个零推理开销的机制,这是把工业检索的效率约束内化进方法设计而非事后压缩。其二,Evidence-Grounded Typed Latent Reasoning 把 CoT 的'定位-对齐-拒绝'结构蒸馏成 4 类 typed latent token,配以 anchor softmin 分配 + 平衡正则避免锚点塌缩,这是首次把显式 CoT 推理在不输出文本的前提下嵌入双编码器前向。其三,Cross-Conditional Reconstruction 把嵌入当作解码瓶颈做双向 NTP/MTP,并提出 representation completeness 度量 $\mathrm{acc}@K=\frac{\sum_i\sum_{t=1}^{L_i}\mathbf{1}[x_{t,(i)}\in\mathrm{TopK}]}{\sum_i L_i}$(式 31,$L_{max}=10$),把'嵌入是否充分'从主观判断变成 $[0,1]$ 可比较、可跨数据集的工程指标,作者明确表示用它指导工业优化。其四,整套设计做到了'训练时强生成监督、推理时纯稠密检索'的解耦,使得 2-B 增益零在线开销、2-A 仅增加 <1ms/query(见表 5),这在公开论文里很少见地同时报告了学术指标、工业相对增益、在线 A/B 和延迟四类证据。
实验结果
核心发现分四组。其一,公开基准 MMEB-v2 上 DME 在两个尺度都达到同档 SOTA:DME-2B 总分 74.8、DME-9B 总分 78.4,分别超过同档 Qwen3-VL-Embedding-2B(73.2)和 Qwen3-VL-Embedding-8B(77.8),并在视频(2B 65.6 / 9B 70.8,远高于 Qwen3-VL 的 61.9/67.1)和视觉文档(2B 79.9 / 9B 82.0)上领先最明显。其二,增益不集中在单一模态:2B/9B 在 Image/Video/VisDoc 三组分别为 75.9/79.8、65.6/70.8、79.9/82.0,跨越分类、QA、检索、grounding、moment retrieval、VisRAG、OOD 共 78 个数据集的全面性提升,说明两阶段框架对 compact 与大模型都有效。其三,相对 CoT 类基线(IFM-TTE-8B 74.1、TTE-v2-7B 75.7、Embed-RL-4B 68.1),DME 用轻量 latent token 推理而非显式 CoT 文本或 cross-encoder 重排,证明隐式推理路线在质量-延迟上更优。其四,工业落地:在抖音自研离线评测上以 DME 初始化并迁移部分技术继续训练,整体相对前线上模型提升 2.92%,四个跨模态方向全面提升(Text2Video +3.10%、Text2Image +3.03%、Image2Image +2.70%、Image2Video +2.83%),在线 A/B 验证核心业务 Lifetime 指标 +0.1%。其五,representation completeness 表 4 给出语义充分性的直接量化:自身重建 q2q/d2d 在 All 上 Top-1 达 87.9%/74.3%、Top-10 超 92%;跨方向 d2q 达 87.7%、q2d 达 65.9% Top-1,VisDoc 因文本规整最易重建(q2d 95.1%)、视频因时序信息差最难(q2d 59.2%)。累积消融表 3 显示从 70.9→74.8 共 +3.9 分:Stage 1 +1.6(主要 Video 55.3→59.3、VisDoc 77.1→79.0),Stage 2-A +1.3(Video 59.3→63.7 单步最大),Stage 2-B +1.0(三组均衡提升)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| MMEB-v2 总分(2B 档) | 官方聚合分(78 数据集) | DME-2B 74.8 | Qwen3-VL-Embedding-2B 73.2 / WeMM-Embedding-2B 71.2 / VLM2Vec-V2 59.2 | 比同档最强 Qwen3-VL-2B 高 1.6 分;其中 Video 65.6 vs 61.9(+3.7)、VisDoc 79.9 vs 79.2(+0.7) |
| MMEB-v2 总分(9B/8B 档) | 官方聚合分 | DME-9B 78.4 | Qwen3-VL-Embedding-8B 77.8 / TTE-v2-7B 75.7 / IFM-TTE-8B 74.1 | 比 Qwen3-VL-8B 高 0.6 分,Video 70.8 vs 67.1(+3.7)、VisDoc 82.0 vs 82.4(-0.4,仅此一项略低) |
| 抖音工业离线评测(四方向平均) | 相对前线上模型的检索质量提升 Δ | DME 初始化 + 迁移技术继续训练 | 抖音前线上生产模型 | 整体 +2.92%;Text2Video +3.10%、Text2Image +3.03%、Image2Video +2.83%、Image2Image +2.70% |
| 在线 A/B(抖音搜索) | Lifetime(LT) 业务指标 | DME 部署于生成式搜索、图像搜索、AI 搜索 | 线上基线 | LT +0.1%(业务级显著) |
| Representation completeness acc@1(All 合并) | 教师强制 Top-1 命中率 | q2q 87.9% / d2d 74.3% / d2q 87.7% / q2d 65.9% | 无(本文新提出的语义充分性度量) | 证明嵌入 information-complete,可解码出对端语义而非仅判别 |
局限与改进
作者承认的局限主要有三:一是 representation completeness 用 greedy 解码且 $L_{max}=10$ 截断,仅评测每样本前若干 token,细粒度词(如'October 17, 1995'只恢复成'October')并不精确,作者明确说目标不是无损重建而是语义保真,因此该指标对长文本、数值密集内容的刻画有限。二是表 1 显示 DME-9B 在 VisDoc 的 OOD 子项(82.0 vs Qwen3-VL-8B 82.4)略低,说明在分布外视觉文档上未必全面领先。三是视频跨方向 q2d 仅 59.2%,反映纯文本 query 与长时序视觉目标之间的信息鸿沟仍未弥合。我自己的观察还有:报告未公开 Stage-2 的关键超参($\tau_{CL}, \tau_{anc}, \tau_{traj}, \mu, \alpha, \lambda_*, D$)和教师模型生成结构化监督的 prompt 与质量过滤细节,也未报告训练算力/步数/学习率曲线,使'语义充分性提升'在多大程度上来自新增机制、多大程度来自 25M+5M 数据与更大骨干难以严格归因;另外自研工业离线评测集未公开,2.92% 的工业增益无法被第三方复核。
独立分析的弱点
独立分析有四个弱点。第一,对教师监督质量的强依赖:Stage 2-A 的证据定位、typed 轨迹、本地摘要全部由 Seed-2.0-Pro 生成,结构化锚点的准确率直接决定 latent 推理上限,若教师在 OCR 稀疏视频、抽象概念图上输出噪声 anchor,会同时污染 $\mathcal{L}_{hit}, \mathcal{L}_{sem}, \mathcal{L}_{align}$;改进方向是用检索反馈做教师自一致性过滤或引入轻量 RL 让 anchor 分配对最终检索指标负责。第二,representation completeness 指标截断在前 10 token、用 greedy 解码,对长文档与数值/日期密集内容失真,可改为 sliding-window 评测 + beam 解码 + 针对关键实体(数字、专有名词)的细粒度 acc。第三,2-B 的 MTP 深度 $D$、NTP/MTP 权重 $\lambda_{NTP}, \lambda_{MTP}$ 的敏感性未做消融,且 MTP 模块只在训练用、推理丢弃,存在'训练-推理表征分布不一致'风险,建议加 knowledge distillation 把 MTP 头的知识压回主 backbone 或报告表征漂移度量。第四,视频跨方向 q2d 仅 59.2%,时序建模仍弱,可在 anchor 机制里引入显式时序位置编码或 frame-group anchor,并扩充长视频字幕数据。每个弱点都对应一个可工程化的改进路径。
未来方向
作者在结论里明确提出两个 scaling 方向:一是 data scaling,扩大并多样化多模态训练语料以拓宽模态与任务覆盖;二是 model-size scaling,用更大骨干训练 DME 以提升表征容量,并称初步尝试已带来持续增益。基于本文成果可延伸的方向至少还有:把 representation completeness 的 acc@K 升级为可微奖励,用 RL 直接对齐检索质量而非教师状态;把 typed latent 推理从 4 类角色扩展为可组合的检索算子库(如加入'排序''聚合''时间约束'),支撑更复杂的多约束 query;探索把 Cross-Conditional Reconstruction 推广到非文本对端(如用文本嵌入重建视频关键帧 caption、用视频嵌入重建 OCR),形成全模态双向瓶颈;以及在 agent 检索工具场景下,把 DME 的隐式推理与 agent 的显式规划结合,做'隐式粗排 + 显式精排'的混合架构。
复现评估
复现难度偏高,属于'方法清晰但资源门槛大'的一类。有利因素:骨干明确为 Qwen3.5,整体两阶段框架、anchor 注意力(式 15-16)、softmin 分配与平衡正则(式 35-39)、typed latent 三项损失(式 49-51)、NTP/MTP(式 22-28)和 completeness 度量(式 31)都给出完整数学定义,公开基准 MMEB-v2 与多数 Stage-1 公开数据集(MS MARCO、NQ、COCO、LAION 类等)可获取,部分基线(Qwen3-VL-Embedding、GME、VLM2Vec-V2、IFM-TTE 标 †)有 checkpoint。障碍因素:约 25M Stage-1 对中含自研长文本匹配、合成图文、长视频字幕等私有数据,Stage-2 部分数据与抖音离线评测集不公开;关键训练超参(温度、margin $\mu$、融合系数 $\alpha$、各 $\lambda$、MTP 深度 $D$、教师 prompt 与质量过滤)未披露;2B 与 9B 两档训练需要大规模 GPU(延迟测试用了 8 张高性能 GPU),完整复现需可观算力。结论:学术思路可中小规模复现验证趋势,但工业级绝对数值(尤其 2.92% 工业增益、78.4 MMEB-v2)难以第三方严格复现。
论文图表
三栏示意图定性对比三类范式:(a) 双编码器对比,低延迟但表征粗粒度;(b) 在嵌入前先生成显式 CoT,细粒度但高延迟;(c) DME 同时做 latent reasoning 与跨条件生成监督,低延迟且细粒度。三栏分别画出 query/target 两侧 MLLM 与损失项(对比损失、显式/latent CoT 损失)。
这张图直接呈现 DME 的核心定位——在效率-精度二维空间里如何同时占据'低延迟'和'细粒度'两个象限,是理解 motivation 和 method 衔接的最佳入口。