嵌入模型的困境:LLM 更强,但代价几何? The Embedder's Dilemma: LLMs Are Better, but at What Cost?
LLM 与嵌入模型在 37 项任务上整体打平,但成本最高 1431 倍、吞吐低 2.5–736 倍
前置知识
文本嵌入模型
把文本映射为固定维度稠密向量的编码器模型,靠对比学习、难负例挖掘和多阶段蒸馏训练,使语义相近的文本在向量空间中靠近;检索与相似度只需计算 $\cos(u,v)$,文档可离线编码成索引。代表有 E5、GTE、Qwen3-Embedding、SFR-2 等,参数量从 118M 到 14B。
本文的一半主角。理解它一次编码、离线索引、在线只做向量比对的推理模式,才能明白为什么它在成本和吞吐上对 LLM 有数量级优势。
双编码器与交叉编码器
双编码器分别独立编码查询和文档,再做向量比对,文档可离线处理但两者没有交互;交叉编码器把查询和文档拼在一起联合编码,精度更高,但每个查询-文档对都要跑一次前向。本文把它推广为一个谱系:按与查询联合读取的文档数从 1 到 N 排列。
这是论文的核心解释框架(Figure 5)。LLM 语料上下文检索就是联合读取全部 N 篇文档的极端情形,成本随查询重复计算,理解这一点才能看懂成本排序。
MTEB 与 MTEB(LLM)
MTEB 是大规模文本嵌入基准,覆盖分类、语义文本相似度(STS)、聚类、配对分类、检索等任务类别并维护公开榜单;MTEB(LLM) 是本文发布的 37 任务子集版(Hugging Face 上的 mteb/llm-eval-*),以固定种子 42 采样,让生成式 LLM 与嵌入模型在完全相同的数据上对垒,且兼容 MTEB 框架接口。
所有实验都在这套数据上进行,论文结论的可信度取决于这套受控子集的设计,包括为什么不用完整 MTEB(eng, v2)(生成式评测贵几个数量级)。
Pareto 前沿
在成本-质量二维坐标里,如果不存在另一个模型既更便宜又更高质量,该模型就位于 Pareto 前沿;前沿刻画每一档预算能买到的最好质量,比单一榜单名次更能指导部署决策。本文在对数成本轴上画出 36 个模型的跨范式前沿。
论文的核心结论就是前沿的构成:前沿由领先的嵌入模型加上唯一的 LLM(Gemini 3.1 Pro)组成,Pro 仅以 1431 倍成本把前沿延展 0.4 分。
语料上下文检索
把整个小语料(82 到 415 篇文档)连同序号一起放进 LLM 提示,让模型直接输出相关文档编号,属于生成式检索的极端形式;配合 prompt caching,以 $r_{cache}=r_{in}/10$ 的缓存单价摊销语料前缀,使短上下文模型也能在相同数据上被评测。
这是 LLM 检索得分的来源协议,也直接决定了检索类成本数字;作者强调生产级语料无法整段塞进提示,因此报告的成本差距只是下界。
推理 token 与思考 token 税
推理型 LLM 在给出答案前会自生成思维链(chain-of-thought)token,这些 token 按输出 token 单价计费。本文统计其占 LLM 推理成本的 28%–81%,并通过消融发现对多数模型关闭或调低推理后检索质量不降反升,作者将这一成本与收益的错配命名为思考 token 税。
它是解释 LLM 成本结构的机制性发现,也给出了何时值得开推理的实践指南,是全文最具工程价值的结论之一。
nDCG@10 与 Recall@1
检索排序质量指标:nDCG@10 衡量前 10 位结果的分级相关性并做位置折损归一,常用于 BEIR/BRIGHT 等基准;Recall@1 只看排名第一的文档是否命中,是 MTEB(LLM) 六个检索任务的官方指标。
论文所有检索结论都以它们计:如 BRIGHT 上重排把 22.3 提到 35.1 nDCG@10,MTEB(LLM) 检索均值 64.5 对 56.0,没有这两个指标就读不懂实验部分。
研究动机
在 RAG 与语义搜索系统中,文本嵌入模型长期是默认组件:E5、NV-Embed、SFR-2、Gemini Embedding 等依靠对比学习、难负例挖掘与多阶段蒸馏在 MTEB 榜单上不断刷新纪录。但推理密集检索基准 BRIGHT 显示,最强嵌入模型只有 18.3 nDCG@10,而 LLM 增强的检索最多能提升 12.2 分,说明双编码器独立编码在需要跨文档推理时会系统性失效。实践者因此面临一个现实抉择:要不要用 LLM 替换嵌入管线?已有文献却回答不了:Bucher & Martini (2024) 只覆盖分类,发现微调编码器领先零样本前沿 LLM 5 到 75 分 F1;BEIR、BRIGHT 只测检索;几乎没有工作在统一任务子集上同时报告质量、逐 token 的 API 成本和同硬件 GPU 吞吐。于是 LLM 是否值得替换这个问题,长期停留在印象和厂商宣传层面,缺一张把质量、价格、速度放进同一坐标系的可控对照。
本文的目标是本文的目标是构建首个跨范式、成本感知的嵌入能力基准 MTEB(LLM),用固定种子 42 采样的任务子集,让 10 个前沿 LLM(6 个家族:Gemini 3.1 Pro、Gemini 3 Flash、Gemini 3.1 Flash Lite、DeepSeek-R1、DeepSeek-V4-Flash、Qwen3.6-27B、Qwen3.6-35B-A3B、GLM-4.7、Kimi-K2.6、MiniMax-M2.7)与 26 个嵌入模型(118M 到 14B 参数)在完全相同的 37 个任务上对比,覆盖分类、STS、聚类、配对分类、检索五大类。同时为每个模型精确核算成本——LLM 按 API 逐 token 计费、嵌入按 H100 吞吐折算美元——并测同卡吞吐,画出跨范式的成本-性能 Pareto 前沿。最终回答一个具体工程问题:你应该用 LLM 替换文本嵌入管线吗?如果不该全换,应该在哪类任务上换、怎么混合。
与已有工作不同的是,本文的独特切入有三点。其一,把成本当一等公民:不满足于精度排名,而是给出每个模型跑完一次基准的美元成本(嵌入 $0.001–0.22,LLM $3.16–154.14)和同一块 H100 上的 token/s 吞吐,构造跨范式 Pareto 前沿而非单一名次,并做成本敏感性分析(同一比值在不同硬件与定价假设下为 338 到 2424 倍)。其二,评测协议对齐真实部署:嵌入侧用 kNN 分类、余弦相似度检索、k-means 聚类,LLM 侧用零样本提示与语料上下文检索,比较的是实践者实际拿到的完整管线,而非模型内在上限。其三,首次量化思考 token 税:用开关推理的消融,把推理 token 占推理成本 28–81% 这一结构事实与其质量收益并排呈现,直接回应 test-time compute 该不该开的争论,并发现降推理预算在多数模型上保住甚至提升检索质量。
核心方法
论文的方法是一条受控对照加精确记账的评测流水线,把两种范式放到同一起跑线:所有模型跑同一份 MTEB(LLM) 子集(固定种子 42,发布于 mteb/llm-eval-*),26 个嵌入模型本地跑在单张 H100 80GB 上,10 个 LLM 经 Gemini API 或 OpenRouter 调用。嵌入侧按部署惯例:分类用训练集嵌入上的 kNN,STS 与检索用余弦相似度 $\cos(u,v)$,聚类用 k-means,配对分类用余弦加阈值扫描;LLM 侧用零样本结构化输出,检索用语料上下文协议。成本双轨核算:嵌入按 $r_{GPU}/T$,即 $2.49/小时$ 的 H100 spot 价除以每小时 token 吞吐;LLM 按公式 $\text{Cost} = (input-cached)\cdot r_{in} + cached\cdot r_{cache} + (total-input)\cdot r_{out}$ 逐 token 计费,$r_{cache}=r_{in}/10$,生成 token(含思维链)按输出价计。
核心创新是跨范式 Pareto 前沿加思考 token 税。与以往两条路线都不同:GritLM 一类工作把 LLM 当嵌入器用,本文的 LLM 完全不做嵌入训练,纯靠提示完成嵌入任务;BEIR/BRIGHT 类工作只测检索,本文覆盖全部五类任务。LLM 检索采用语料上下文协议:把 82 到 415 篇文档的整个语料连同序号放进单个提示,用 prompt caching(缓存价 $r_{cache}=r_{in}/10$)摊销语料前缀成本,这既让短上下文模型可评,也显式暴露了生成式检索的成本随语料规模 N 线性增长的结构问题。消融设计把花钱和买到东西分开:对 Gemini 3 Flash 设 reasoning_effort=low,对开源模型在服务层直接关闭推理,量化推理 token 占 28–81% 成本时究竟换来多少分。Figure 5 的注意力掩码图把 bi-encoder、cross-encoder、LLM listwise、语料上下文统一为与查询联合读取多少文档这单一变量,是全文的方法论骨架。
方法步骤详情
八步流水线。一、构建 MTEB(LLM):从 MTEB 原任务以种子 42 抽子集,得分类 8、STS 10、聚类 9、配对分类 4、检索 6 共 37 个任务,语料控制在 82–415 篇以适配短上下文模型。二、跑嵌入:26 个模型在单张 H100 80GB、序列长 512 最大批量下推理。三、跑 LLM:10 个模型零样本提示,分类返回结构化标签、STS 返回浮点分、聚类返回 JSON、检索用语料上下文加缓存。四、成本记账:LLM 从 usage_stats 提取 token 按式 (1) 计费,嵌入按 $r_{GPU}/T$ 折算。五、吞吐对比:两个开源 LLM 用 vLLM 服务在同一 H100 上与嵌入同卡测 token/s。六、检索后重排:BEIR 与 BRIGHT 上交叉 4 个一阶检索器与交叉编码器、LLM listwise 重排器,top-100 短名单。七、消融:降推理预算与 5-shot 分类。八、统计:10000 次配对 bootstrap 检验。
技术新颖性
新颖性体现在四个层面。数据层面,MTEB(LLM) 是首个让 LLM 与嵌入模型在全部五类 MTEB 任务、同一份数据子集上对垒的基准,且沿用 MTEB 框架的任务与结果接口,新模型可无缝加入评测。度量层面,首次给出双范式统一坐标系下的成本-性能 Pareto 前沿,并附成本敏感性分析:1431 倍这一比值在商业嵌入 API($0.10/百万 token)假设下降到 338 倍,在 L4 GPU($0.49/小时)假设下升至 2424 倍,数量级结论稳健。机制层面,提出并量化思考 token 税:推理 token 占推理成本 28–81%,而降低推理预算使生成 token 减少 54–96% 后,Flash 的 6 个检索任务全部保持或提升、跨家族 6 模型中 4 个保持或提升,与 Lu et al. (2025) 发现 CoT 重排劣于直接输出相互印证。架构层面,用注意力掩码图把四种架构统一为与查询联合读取文档数的单变量谱系,揭示成本随查询重复计算、质量随联合阅读增长的同序规律,解释了为何重排是比全文入上下文更经济的加推理方式。
实验结果
五大发现。一,总量打平:Gemini 3.1 Pro 均分 77.6 对最佳嵌入 Octen-8B 77.2,差 0.4 分;bootstrap 检验 $\Delta=+0.3$、$p=0.85$、95% CI $[-2.4,+3.1]$,属噪声。二,优势按任务分化:检索上 LLM 领先 8.5 分(64.5 对 56.0,六个任务赢五个);分类上嵌入反超 5.6 分(SFR-2 90.8 对 85.2);聚类、STS、配对分类统计打平。三,成本鸿沟:Pro 单次基准 $154.14 对 Octen-8B $0.11,1431 倍(敏感性区间 338–2424 倍)。四,吞吐差 2.5–736 倍:同卡 H100 上开源 LLM 仅 5400–5900 token/s,嵌入从 14700(F2LLM-14B)到 430 万 token/s(mE5-small)。五,重排验证分工:BRIGHT 上 LLM listwise 把强嵌入一阶从 22.3 提到 35.1 nDCG@10($10–30,远低于全文上下文 $154);BEIR 上纯嵌入 63.1 反超最佳重排 60.3;MoE 的 Qwen3.6-35B-A3B 以 $10 达 33.6,性价比优于 27B 的 $30/35.1。消融:降推理预算后 Flash 六个检索分全部保持或提升、跨家族 4/6 保持或提升、分类变化小于 1 分;5-shot 不优于零样本。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| MTEB(LLM) 综合均值(37 任务) | 五类任务分数均值(0–100) | Gemini 3.1 Pro:77.6 | Octen-8B(最佳嵌入模型):77.2 | +0.4 分但属统计噪声(p=0.85),代价是 1431 倍成本 |
| MTEB(LLM) 检索(6 任务) | Recall@1 类别均值 | Gemini 3.1 Pro:64.5 | Octen-8B:56.0 | LLM +8.5 分,赢下 6 个检索任务中的 5 个,唯一 LLM 明确领先的类别 |
| MTEB(LLM) 分类(8 任务) | Accuracy 类别均值 | SFR-2(最佳嵌入模型):90.8 | Gemini 3.1 Pro:85.2 | 嵌入 +5.6 分,细粒度任务(Banking77、MassiveIntent)差距更大 |
| BRIGHT 推理密集检索(重排实验) | nDCG@10 | Qwen3-8B 一阶 + LLM listwise 重排:35.1 | Qwen3-8B 纯一阶检索:22.3 | +12.8 分,重排成本仅 $10–30(全文上下文要 $154) |
| BEIR 语义检索(重排实验) | nDCG@10 | Qwen3-8B 强嵌入纯一阶:63.1 | 最佳重排配置:60.3 | 纯嵌入反超最佳重排 +2.8,语义检索无需重排 |
| MTEB(LLM) STS(10 任务) | Spearman 相关类别均值 | Qwen3-E-4B:88.8 | Gemini 3.1 Pro:88.5 | 0.3 分,统计打平 |
| 同硬件吞吐(单张 H100) | token/s | mE5-small:4,300,000 | Qwen3.6-27B(vLLM):5,900 | 嵌入快 2.5–736 倍(对最大 F2LLM-14B 为 14700 token/s,2.5 倍) |
局限与改进
作者承认的局限有三:其一,语料上下文协议只适用于 82 到 415 篇的小语料,生产级语料必须先建索引,因此报告的检索成本差距是下界,已用 BEIR/BRIGHT 重排实验补位;其二,十个 LLM 只是快速演进前沿的一个快照,但 MTEB(LLM) 兼容 MTEB 框架,新模型可持续纳入;其三,嵌入在配对分类上享受测试集后验阈值优化(MTEB 惯例),LLM 没有对应物。我自己的观察:分类对比的监督不对齐是双刃剑——嵌入 kNN 用了完整标注训练集而 LLM 只有标签名加至多 5 个示例,虽贴近部署现实,却回答不了表征能力孰强的科学问题,作者也承认分类后训练的 LLM 会缩小差距;37 个任务的子集偏小,类别均值可能掩盖单任务噪声,论文未报告逐任务方差;同卡吞吐只测了两个能塞进单张 H100 的开源 LLM,闭源模型的实际服务吞吐缺失;成本基于 2026 年 3 月价格,API 定价波动大,1431 倍会随时间漂移;推理关闭消融只覆盖检索与分类,聚类和 STS 上关推理的代价未单独报告。
独立分析的弱点
独立分析四点弱点。一、检索语料过小:6 个检索任务语料仅 82 到 415 篇,避免了难负例和索引问题,Recall@1 在这么小的候选池上区分度有限,结论外推到百万级语料的把握不足;改进方向是把语料上下文与 ANN 索引组合,报告成本随语料规模 N 的缩放曲线。二、零样本提示空间未探索:作者只试了 5-shot 且持平或更差,但没试自一致性、更强的任务指令、或让 LLM 生成向量再接 kNN 的混合形态,LLM 分类 85.2 分可能被低估。三、嵌入的域内拟合未剥离:SFR-2 等领先嵌入的对比训练数据与分类任务标签空间重叠,5.6 分的分类领先中多少是记忆而非泛化,论文只做定性讨论,可用去除标签空间重叠后的 held-out 任务量化。四、统计检验只在类别层面做,37 个任务的多次比较未做多重校正,且逐任务胜负(嵌入在 8 个分类任务中 7 个匹配最佳 LLM,检索只有 1 个)比类别均值更有信息量但只在附录图里呈现。这些弱点不推翻主结论,但影响结论的边界条件。
未来方向
作者提出的方向:借助 MTEB 框架持续纳入新模型使评测随前沿扩展;呼吁学界在精度榜之外报告 Pareto 前沿与显著性检验。基于其成果可延伸的工作:第一,把嵌入粗检加 LLM 短名单重排的混合架构做成端到端成本-质量优化问题,在延迟与预算约束下自动选择短名单大小 k 和重排模型——数据显示 MoE 的 Qwen3.6-35B-A3B 以 $10 达 33.6 nDCG@10(27B dense 要 $30 才到 35.1),说明小 MoE 重排器值得系统研究。第二,自适应推理预算:既然降推理在多数模型上保持检索质量,可训练按查询难度路由推理深度的控制器,难查询开推理、易查询直出。第三,补齐分类公平性:给 LLM 做分类后训练或检索增强分类(把标注样本检入上下文),检验 5.6 分差距是否消失。第四,扩展到多语言与更难推理基准(BRIGHT 全集、多跳 QA),绘制推理 token 在这些任务上的边际收益曲线,找到思考 token 税真正为负的区间。第五,把同卡吞吐测量扩展到量化、投机解码等推理优化后的 LLM,检验 2.5 到 736 倍吞吐差是否为自回归解码的架构本质。
复现评估
复现性在同类论文里属最优档。代码、数据与全部结果开源在 GitHub(embeddings-benchmark/embedders-dilemma),37 个任务子集以固定种子 42 生成并发布于 Hugging Face 的 mteb/llm-eval-*,评测复用 MTEB 框架接口,新模型即插即评。算力门槛低:嵌入侧单张 H100 80GB 跑完 26 个模型(一次基准 $0.001–0.22);LLM 侧走 Gemini API 与 OpenRouter 公开价,单次全基准 $3.16–154.14,几百美元总预算即可复现主表。吞吐复现需用 vLLM 服务两个开源 LLM 并自测 token/s。难点有三:API 结果随模型版本与定价漂移,须记录调用日期;推理关闭依赖各服务商 serving 层参数,实现不完全可移植;正文只给头部 20 个模型分数,其余明细(Table 17、18)需从仓库数据文件获取。总体是有 API key 加一张 H100 就能复现的友好级别。
论文图表