← 返回 2026-08-26

WeMM-Embedding:微信通用多模态嵌入技术报告 WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report

Junjie Zhou, Ke Mei, Lei Li, Tianyi Wang, Fengyun Rao, Jing Lyu 📅 2026-08-25 👍 67 2026-08-30 18:30
Matryoshka表示学习 多模态嵌入 对比学习 知识蒸馏 跨模态检索

两阶段训练的多模态嵌入家族:2B 超越 8B 基线,9B 以 80.6 分居 MMEB-v2 榜首

前置知识

InfoNCE 对比学习

把每个训练样本对表示为(源,正例目标),同 batch 内其他样本的目标作为负例,用温度参数 $\tau$ 缩放余弦相似度后做 softmax 交叉熵,拉近正例、推远负例。负例越相关,学到的表示判别力越强。

WeMM-Embedding 的 Stage-1 主损失就是 InfoNCE,理解 in-batch negatives 与可学习温度是读懂其训练目标的前提。

难负例挖掘

随机负例往往太容易被区分,训练后期梯度信号微弱;难负例是那些与查询语义相近但不匹配的候选,通常用当前模型自己检索 top 候选或用生成模型构造,能迫使模型学习更细粒度的判别边界。

本文 Stage-2 精选数据的核心手段之一就是为文本目标用 MLLM 生成、为视觉目标用中间 checkpoint 检索挖掘难负例。

Matryoshka 表示学习(MRL)

训练时在多个截断维度(如 64、256、512、2048)上同时计算损失并加权,使表示向量的前缀本身也是合格嵌入;推理时单次前向后按需截断前 $d$ 维并重新 L2 归一化,即可获得不同维度的嵌入以平衡存储与精度。

WeMM-Embedding 的灵活输出维度完全由 MRL 实现,论文还专门分析了各任务在降维下的性能保留率(256 维保留 98.7%)。

知识蒸馏与 KL 散度

让小模型(学生)模仿大模型(教师)的输出分布。$\mathcal{D}_{KL}(P_T\lVert P_S)$ 度量两个分布的差异,学生通过最小化它来继承教师的软标签;软标签保留了类别/候选之间的相对关系,比 one-hot 监督信息量更大。

Stage-2 的双向嵌入蒸馏就是把 batch 内源到目标、目标到源两个方向的相似度分布做 KL 对齐,是小模型涨分的关键(2B 上 +0.9 分)。

CoSENT 排序损失

一种成对排序目标:不要求相似度绝对值对齐标签,只要求相关性更高的样本对相似度更大,对标签差异 $\exp(\gamma [s_j-s_i])$ 做软加惩罚,训练稳定且适合有序相关性标注(如 0/1/2 分级)。

本文在其上加权改造为 score-gap 版本 $w_{ij}=\max(|y_i-y_j|,\epsilon)$,用于分级相关性数据和 reranker 分数监督。

Semantic-ID 与残差量化

把嵌入向量离散化成一串码字 ID:残差 k-means(RQ-KMeans)逐级对残差再聚类,几级码本串联即得紧凑的离散标识符,既可用于重采样统计语义密度,也可作为推荐系统的索引特征。

本文用中间 checkpoint 对样本对生成 3 级 Semantic ID,按码本密度引导重采样,是精选数据构建的起点。

研究动机

早期的 CLIP 式双塔模型通过模态专属编码器做大规模跨模态对齐,在图文检索上很成功,但其编码路径天然无法联合表示图文交错文档、组合式多模态查询、视频配 ASR 转写这类混合输入;后续工作把预训练视觉编码器当作视觉分词器接给文本编码器(如 VLM2Vec、GME),把范式扩展到 any-to-any 匹配,但随着多模态嵌入扩展到分类、推荐、聚类、agent 系统等日益多样的任务和输入组合,编码器方案的通用性明显不足。数据层面还有两个顽疾:其一,语义分布偏向高频模式,大规模弱监督图文/视频文本对覆盖广但噪声大、描述可能有事实错误;其二,监督信号粗糙——带人工分级相关性标注的样本(item-to-item 检索、推荐场景常见)常被当二元正例对处理,序数信息被丢弃,限制了细粒度匹配能力。工业界还需要同一套表示同时服务搜索、推荐、分类和 agent 系统,对覆盖广度与推理效率同时提出了要求。

本文的目标是本文的目标是构建一个家族化的通用多模态嵌入模型 WeMM-Embedding(2B、4B、9B 三个规格),统一支持文本、图像、视频、视觉文档以及任意交错组合的多模态输入,并通过 Matryoshka 表示学习支持灵活的输出维度。性能目标是在 MMEB-v2、MMEB-v3 等公开基准上超越所有开源和专有模型——具体以 9B 在 MMEB-v2 官方榜单登顶(80.6 分)、2B 以约 1/4 参数量反超此前领先的 8B 开源基线(77.9 vs 77.8)为标志。实用目标是经 26 个任务的微信内部基准(2B 得 72.0,基线 60.9)和 14 个线上 A/B 实验验证后,在视频号、公众号、朋友圈与电商的推荐和搜索系统中大规模部署。方法学目标则是设计一套渐进式两阶段训练策略,在保持广度覆盖的同时持续提升相关性与表示质量。

与已有工作不同的是,本文的独特切入角度有四点。其一,把分类、QA、检索、caption、分级相关性等异构任务统一表达为五元组 pair 格式 $z_i=(I_i,q_i,c_i,N_i,y_i)$(可选指令、源实例、配对目标、显式难负例集、分级相关性分),使数亿样本能进入统一的多任务训练框架而不丢失各自原始监督。其二,训练策略是渐进式两阶段:先在数亿异构对上做大范围对齐,再在约十分之一规模的精选集上用语义更均衡的数据、更有挑战性的负例和更丰富的相关性监督精炼,而非一次性混合训练。其三,跨尺度知识迁移走双路径:2B/4B 用冻结的 9B 同门模型做在线双向嵌入蒸馏;9B 没有更大教师可用,则训练多个互补数据配方的专用 Stage-2 变体再做模型合并。其四,评估不止步于公开榜单,还引入 26 任务内部基准与 14 个线上 A/B 实验,把学术 SOTA 与工业可用性绑定验证,这是多数纯学术嵌入工作不具备的。

核心方法

直觉上,先用海量数据把多模态表示空间'摊开',再用少量精选数据把细粒度相关性'磨尖'。底座是原生支持图文视频交错输入的 Qwen3.5 MLLM:输入序列末尾追加专用 token,取其最后层隐状态做 L2 归一化得到表示 $e_D=h_{emb}/\lVert h_{emb}\rVert_2$;同一因果注意力框架还允许多个 token 插入不同位置,如视频 token 后放一个、序列末尾放一个,一次前向可同时得到纯视频和视频+文本两种表示。MRL 使模型支持 64 到 2048 的多档维度,推理时单次前向后前缀截断再归一化。训练分两阶段:Stage-1 在数亿对上以 InfoNCE(配 duplicate-aware masking)加 score-gap 加权 CoSENT 做多任务对齐,且在每个 MRL 维度上独立计算损失并按 $\alpha_d$ 求和;Stage-2 在约十分之一规模的精选集上按监督类型选目标函数,并叠加双向嵌入蒸馏 $\mathcal{L}_{Stage2}=\mathcal{L}_{Task}+\lambda_{Emb}\mathcal{L}_{Emb}$,最后扩大视觉输入预算(更高分辨率与更密视频采样)。

核心创新集中在'如何让统一框架兼容异构监督'。其一是 duplicate-aware masking:分类类任务共享候选空间,同 batch 内候选可能语义相同,直接用 in-batch negatives 会引入假负例;本文按相似度阈值 $\tau_{dup}$ 把近似重复的源所关联的候选、以及与当前正例高度相似的目标从负例池双向屏蔽(消融去掉掉 0.5 分)。其二是 score-gap 加权 CoSENT:对带分级标注 $y_i$ 的样本不丢弃序数信息,按相关性差 $w_{ij}=\max(|y_i-y_j|,\epsilon)$ 加权成对排序约束,标签差越大约束越强。其三是双向嵌入蒸馏:不要求学生拟合教师绝对向量,而是在线对齐 batch 内'源→候选'与'正例→源'两个方向的相似度分布(双向 $\mathcal{D}_{KL}$),保留候选间相对结构,比 one-hot 对比监督软得多,且无需离线标注即可跨异构 batch 应用。其四是用 3 级残差 k-means(RQ-KMeans)给样本对生成三元 Semantic ID,按码本密度反向重采样,在不强行均匀化的前提下缓解高频模式过曝。

方法步骤详情

第一步,大规模数据构建:从公开数据集与 web 级弱监督来源收集图文对、视频文本对,叠加合成数据与内部数据,统一为 pair 格式,覆盖弱监督对、caption 对、检索对、分类对、多模态 QA 对、分级相关性对六类,总规模数亿。第二步,精选数据构建(约 1/10 规模):用中间 checkpoint 编码每对样本较长一侧,拟合 3 级 RQ-KMeans 得到 Semantic ID 并按码密度反比重采样;再用 MLLM 校验匹配关系、过滤错配并修正事实错误;补充难负例——文本目标由 MLLM 生成貌似合理但错误的候选,视觉目标用中间 checkpoint 从任务候选池检索挖掘,小子集再用 reranker 打分。第三步,Stage-1 对齐:每 batch 只来自单一数据源保证任务一致,InfoNCE 温度 $\tau$ 可学习,分级数据用 CoSENT 损失,两类损失在每个 MRL 维度上计算后加权求和。第四步,Stage-2 精炼:按监督类型选损失(标准对/难负例批用对比损失、分级批用 $\mathcal{L}_{Rel}$、reranker 批用 $\mathcal{L}_{Rank}$),叠加双向嵌入蒸馏并扩大视觉输入预算。第五步,跨尺度整合:2B/4B 以冻结 9B 为教师蒸馏;9B 训练多个互补数据配方的专用变体后模型合并。

技术新颖性

与 Qwen3-VL-Embedding、GME、DME 等已有 MLLM 嵌入工作相比,本文的新颖性在于:(1) duplicate-aware masking 被形式化为掩码函数 $M_{i,j,c}$ 并经消融验证(去掉掉 0.5 分),使统一 pair 框架第一次干净地兼容了共享标签空间的分类类任务,这是多任务统一训练常被回避的细节;(2) 分级相关性的 score-gap 加权 CoSENT 明确利用了序数标注结构,而不是像常见做法那样把多级标注压扁成二分类;(3) 双向嵌入蒸馏只需 batch 内在线计算、无离线相关性标注即可跨异构 batch 应用,消融显示它是 Stage-2 增益最大的单项(2B 从 76.7 升到 77.6,+0.9),且对紧凑模型价值最大;(4) 面对'最大模型自身缺教师'的死结,用多专用变体 + 模型合并作为 9B 的替代蒸馏方案,是实用的工程创新;(5) 对 MRL 的细粒度分析(图像/视频 256 维保留 98.7%,视觉文档更敏感)为部署提供了可操作的维度选择依据,这类效率-性能权衡分析在同类技术报告中较为少见。

Overview of our multimodal training data. Major data families and representative coverage across diverse task settings and content domains.
Figure 2: Overview of our multimodal training data. Major data families and representative coverage across diverse task settings and content domains.

实验结果

MMEB-v2(78 数据集):9B 总分 80.6 居官方榜单第一,图像/视频/视觉文档分别 81.9/74.3/83.3,超 Qwen3-VL-Embedding-8B(77.8)与 DME-Large(80.2);2B 达 77.9,比 Qwen3-VL-2B(73.2)高 4.7 分、比 DME-Small(74.8)高 3.1 分,并反超 Qwen3-VL-8B;4B 得 79.2,超过所有 8B–9B 基线。MMEB-v3(190 任务):9B V3-All 59.5、4B 58.2、2B 56.0 全面领先(Qwen3-VL-8B 仅 53.5),9B 文本组 48.8、agent 组 51.0;不支持音频的 11 个任务记 0。跨模态检索 12 基准:9B 平均 81.7 超 Gemini Embedding 2 的 79.5;2B 79.8 超所有开源。微信内部 26 任务:2B 72.0 对 Qwen3-VL-2B 60.9(+11.1),五类全胜(搜索 65.5 vs 51.9)。线上 14 个 A/B 全部正向并全量,长尾与新内容收益明显。消融:Stage-2 累计 +2.2(精选数据 +0.9、蒸馏 +0.9、视觉预算 +0.3、reranker +0.1);Stage-1 中任务一致性 batching 影响最大(去掉掉 3.4);MRL 下 256 维保留 98.7% 图像/视频性能,512 维 99.2%。

Benchmarking results on MMEB-v2. Baseline results are taken from the official MMEB leaderboard.
Table 1: Benchmarking results on MMEB-v2. Baseline results are taken from the official MMEB leaderboard.
Evaluation results on MMEB-v3. V3-All averages all 190 tasks, comprising the 78 MMEB-v2 tasks, 53 Text tasks, 47 Agent tasks, 11 Audio tasks, and MCMR.
Table 2: Evaluation results on MMEB-v3. V3-All averages all 190 tasks, comprising the 78 MMEB-v2 tasks, 53 Text tasks, 47 Agent tasks, 11 Audio tasks, and MCMR.
Cross-modal retrieval results on 12 public benchmarks. AVG denotes the average across the 12 datasets.
Table 3: Cross-modal retrieval results on 12 public benchmarks. AVG denotes the average across the 12 datasets.
Evaluation results on the in-house benchmark. AVG denotes the average over all 26 tasks.
Table 4: Evaluation results on the in-house benchmark. AVG denotes the average over all 26 tasks.
Results on MMEB-v2 from a small-scale Stage-1 ablation study using a 2B model.
Table 5: Results on MMEB-v2 from a small-scale Stage-1 ablation study using a 2B model.
Cumulative Stage-2 results of the 2B model on MMEB-v2. Each row reports the configuration after introducing the listed strategy.
Table 6: Cumulative Stage-2 results of the 2B model on MMEB-v2. Each row reports the configuration after introducing the listed strategy.
Performance and efficiency overview of WeMM-Embedding. Left: MMEB-v2 overall performance across different model sizes, compared with representative baselines. Right: Aggregate performance on the MMEB-v2 image and video subsets, a 12-dataset cross-modal retrieval suite, and the 26-task in-house benchmark.
Figure 1: Performance and efficiency overview of WeMM-Embedding. Left: MMEB-v2 overall performance across different model sizes, compared with representative baselines. Right: Aggregate performance on the MMEB-v2 image and video subsets, a 12-dataset cross-modal retrieval suite, and the 26-task in-house benchmark.
MRL analysis of WeMM-Embedding-2B on MMEB-v2. Left: Performance retained on the image, video, and visual-document subsets across embedding dimensions. Right: Performance retained for classification (CLS), question answering (QA), and retrieval (RET).
Figure 3: MRL analysis of WeMM-Embedding-2B on MMEB-v2. Left: Performance retained on the image, video, and visual-document subsets across embedding dimensions. Right: Performance retained for classification (CLS), question answering (QA), and retrieval (RET).
查看结构化数据
任务指标本文基线提升
通用多模态嵌入(MMEB-v2,78 数据集) 总体 AVG 80.6(9B) Qwen3-VL-Embedding-8B 77.8;DME-Large 80.2 较 Qwen3-VL-8B +2.8、较 DME-Large +0.4,居官方榜单第一
通用多模态嵌入(MMEB-v2,参数效率) 总体 AVG 77.9(2B) Qwen3-VL-Embedding-2B 73.2;Qwen3-VL-Embedding-8B 77.8 较同级 +4.7,以约 1/4 参数量反超 8B 基线
文本与 Agent 嵌入(MMEB-v3,190 任务) V3-All 59.5(9B)/ 56.0(2B) Qwen3-VL-Embedding-8B 53.5 9B +6.0,2B 也超过全部对比 8B 级基线
跨模态检索(12 个公开基准) 12 集 AVG(R@1 / NDCG@10) 81.7(9B)/ 79.8(2B) Gemini Embedding 2 79.5;Qwen3-VL-Embedding-8B 76.7 9B 超最强专有模型 +2.2;2B 超所有开源基线
微信内部业务基准(26 任务) 26 任务 AVG 72.0(2B) Qwen3-VL-Embedding-2B 60.9 +11.1,五个任务类别全部领先(搜索类 +13.6)
Stage-2 训练策略累计消融(MMEB-v2,2B) 总体 AVG 77.9(最终配置) Stage-1 checkpoint 75.7 累计 +2.2,其中嵌入蒸馏单项 +0.9
线上 A/B 实验(视频号/公众号/朋友圈/电商) 业务核心指标 14 个实验全部正向并全量上线 线上旧版嵌入模型 内容匹配、推荐质量与用户参与度一致提升,长尾与新内容最明显

局限与改进

作者承认的局限:不支持音频输入,MMEB-v3 的 11 个音频任务直接记 0 分,omni-modal 被列为未来工作;reranker 监督收益不稳定,作者发现仅在有限任务子集上有稳定增益,2B 累计消融中 reranker 只贡献 +0.1,与既有工作的观察一致,说明 query 相关的排序信号在多模态任务间迁移性有限;视觉文档任务对降维最敏感,信息密度高的文档场景用低维嵌入需谨慎。我的补充观察:(1) 9B 的'多专用变体 + 模型合并'方案缺乏原理性分析,合并权重与配方未公开细节,可复现性打折;(2) 内部 26 任务基准与线上 A/B 数据均不公开,工业侧结论无法独立核验;(3) 闭源榜单提交(DME-Large 视觉文档 83.4 高于本文 83.3)说明部分细分赛道并未拉开差距;(4) 训练数据规模只给了'数亿'量级、算力与训练时长完全未披露,成本侧信息缺失。

独立分析的弱点

(1) 模态覆盖缺口:无音频分支使 MMEB-v3 的 11 个任务记零分拖累 V3-All,改进方向是引入 audio encoder 并补音频-文本对扩展为 omni 嵌入,评测协议已现成。(2) 蒸馏只对齐分布不对齐几何:双向 KL 只约束 batch 内相似度分布,未约束师生嵌入空间的全局角度结构,可引入 relational KD 或对教师空间做 Procrustes 对齐进一步抬高小模型。(3) MRL 低维掉点:64/128 维检索退化明显(256 维才恢复到 97% 以上),说明损失权重 $\alpha_d$ 对低维不友好,可探索维度自适应加权或低维专门微调。(4) 任务一致性 batching 依赖批内负例质量,对候选空间巨大的检索任务可引入跨 batch memory bank 或队列式负例扩充。(5) Semantic-ID 重采样基于中间 checkpoint 的语义分布,训练推进后表示漂移会使静态重采样失效,可周期性重估码本密度。(6) reranker 监督 ROI 低(+0.1),与其维护昂贵的专用 reranker,不如把算力投给嵌入蒸馏或数据清洗。

未来方向

作者明确提出的方向:扩展到 omni-modal 输入(音频等多模态)、把模型家族推到更大参数规模、继续改进数据精选与细粒度相关性监督。基于其成果可延伸的方向:(1) 论文已将嵌入派生的 Semantic ID 用于索引与用户序列建模特征,可进一步把连续嵌入与离散 ID 做联合训练,打通生成式检索/推荐与判别式嵌入;(2) 多 token 的单次前向多表示能力(视频-only 与视频+文本)可自然延伸到时刻检索、视频高光定位等细粒度时序任务;(3) MMEB-v3 上 agent 组 51.0 的领先表明指令感知嵌入适合 agent 记忆检索,可结合工具调用轨迹数据做持续学习型 agent 记忆系统;(4) 线上 A/B 观察到长尾与新内容收益显著,提示可针对冷启动内容设计专门的增强管道(如生成式 caption 对扩充);(5) 模型合并作为无教师方案值得系统化研究,例如探索任务向量相加、TIES-merging 等方法与数据配方的联动规律。

复现评估

开源情况较好:模型权重与代码均已发布(HuggingFace collection tencent/wemm-embedding 与 GitHub Tencent/WeMM-Embedding),公开评测集(MMEB-v2/v3、MSCOCO/Flickr30k/DOCCI/TextCaps/VATEX/MSR-VTT/YouCook2/ViDoRe v2 等 12 个检索基准)均可复现论文表格。但完整复现训练存在实质障碍:数亿级训练对中包含 web 级弱监督与内部数据,外界无法获得同等规模与配方的语料;精选数据的 MLLM 清洗、难负例挖掘所用模型与规模、reranker 的结构未充分披露;训练算力、序列长度、batch 组成、训练时长等成本信息缺失;9B 的模型合并权重与配方未细说。因此合理预期是:可以复现推理效果并基于开源权重做下游微调达到接近性能,但要从头复现榜单分数难度较高,整体属于中上难度;2B 模型单张 A100/H100 即可推理,全量复现训练估计需要大规模多机集群。