知识–几何解耦:面向流式推荐的可刷新预训练迁移 Knowledge-Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation
解耦预训练知识与任务几何的所有权,让编码器每日刷新而不破坏迁移
前置知识
预训练-迁移范式(GPSD)
指先用自回归目标在大规模用户行为序列上预训练 Transformer,再把学到的参数(embedding 或 dense 部分)迁移到 CTR 估计、排序等下游任务的训练范式。GPSD 这篇工作证明了在该设置下迁移后的预训练能解锁判别式训练单独无法达到的 scaling 行为。迁移有两个关键设计轴:迁移哪些参数、是否冻结它们。
整篇论文都建立在这个范式之上,作者要回答的就是流式场景下“学什么、怎么迁移”两个根本问题,不理解这个范式就无法理解 KGD 的贡献定位。
下一令牌预测(Next-Token Prediction, NTP)
序列预训练的标准目标,对序列每个位置预测紧接着的下一个 item:$\mathcal{L}_{NTP} = -\sum_{t=1}^{T-1} \log \frac{\exp\langle h_t, e_{i_{t+1}}\rangle}{\sum_{i'\in I}\exp\langle h_t, e_{i'}\rangle}$。它学到的 item embedding 内积近似相邻 item 的对数共现频率,几何结构反映“什么会跟着什么”。
论文的核心批判对象。NTP 把“相邻”当作“有依赖”,但推荐场景里用户序列由多个无关兴趣会话拼接而成,跨会话边界的相邻对其实是噪声。理解 NTP 才能理解 BMTP 为什么需要过滤。
分布漂移(Distribution Drift / Streaming)
指推荐系统的流量分布随时间持续变化:新内容/活动不断上线使 item 池周转,用户不均匀到访、不规则回流使受众周转。论文用 Jensen-Shannon 散度测得 item-ID 和 user-ID 分布相对初始日持续上升、不相邻天之间也持续漂移,证实没有任何固定快照能长期代表分布。
这是整个研究的现实前提。正因为分布持续漂移,预训练不能“一次训完永久用”,必须每日刷新——而刷新又会和任务优化冲突,这正是 KGD 要解决的核心矛盾。
交叉注意力(Cross-Attention)
一种注意力机制,其中 query 来自一个序列(任务侧 reader token $\rho$),key/value 来自另一个序列(编码器的隐状态 $\tilde{H}$)。计算为 $Q=W_Q\rho$、$K=W_K\tilde{H}$、$V=W_V\tilde{H}$。KGD 在此基础上对 K/V 施加 stop-gradient,使信息只能从编码器单向流向任务学习者。
理解它才能理解 KGD 的‘只读接口’如何让任务学习者读取编码器上下文化表示的同时,梯度完全不回传到编码器,从而实现知识与几何的彻底解耦。
低秩正交残差(Anchored Calibration Residual, ACR)
一种参数化方式:任务学习者在预训练 embedding 上叠加一个残差 $\Delta e_i^{(k)} = Z_i^{(k)} B^{(k)\top}$(低秩因子 $r<d$),并通过正则约束 $\Delta e_i^{(k)} \perp e_i^{pre}$,使残差只写在预训练子空间的正交补里。配合标量 $s_k = 1+\text{ReLU}(\tilde{s}_k)$ 保留并锐化预训练方向。
这是论文‘几何解耦’的数学核心。正交约束让任务能在不抵消预训练几何的前提下注入判别式结构,同时预训练 embedding 可以被 detached 共享、持续刷新。
研究动机
工业推荐系统普遍采用预训练-迁移范式,但在流式场景下这个范式遭遇两个具体难题。第一,预训练目标的问题:标准 NTP 把序列中每一对相邻 item 都当成训练信号,而真实用户序列其实是多个无关兴趣会话的拼接——比如 Shopee 真实数据里同一个序列里“自行车齿轮”后面紧接着“裤子”,论文用余弦相似度热力图显示这两类 item 跨会话边界相似度近乎崩溃。把这种相邻但无关的转移监督进去,就等于把噪声写进 embedding 几何。第二,迁移机制的问题:预训练学到的行为知识和下游任务要求的判别式几何,对同一批共享参数施加了冲突的优化方向。论文在 8 个 Amazon 基准上测量预训练梯度与任务梯度的余弦相似度,发现多数时候接近零甚至为负;在损失曲线实验中,仅做预训练时任务损失不降反升,开启任务梯度后预训练损失又回升,呈现双向干扰。第三,分布漂移使任何固定表示变陈旧——JSD 持续上升而不是饱和,所以预训练必须随流量每日刷新,而刷新又加剧了上述冲突。现有缓解手段都只解决了一部分:注意力去噪只降权表示但仍监督原始转移;LLM 重写需要逐序列推理,在十亿级日志上每次刷新都重跑不可行。
本文的目标是论文要构建一个‘可刷新的预训练迁移框架’(refresh-native),同时干净地回答两个根本问题:在‘学什么’上,让预训练只学真正可迁移、跨分布持久的行为知识,而不是会话边界的瞬时噪声;在‘怎么迁移’上,让编码器能够以天为粒度持续刷新其行为知识,而每一次刷新都不会让任务侧已经学到的判别式几何失效,任务优化也不会污染预训练知识。最终目标是使‘知识刷新’和‘任务适应’成为两个相互独立的操作——编码器每天能以单次更新的边际成本刷新,任务迁移始终保持有效,并在工业级真实流上验证这一框架能带来可观的业务收益。
与已有工作不同的是,论文的独特切入角度是把‘行为知识’与‘任务几何’视为两个应该被不同参数集拥有的、可以正交共存的层,而不是让它们竞争同一个表示。GPSD 用‘迁移哪些参数 + 是否冻结’两条轴描述迁移,但这没有覆盖流式场景新增的维度。现有方法各自失败:完全不预训练缺乏干净的结构知识;冻结迁移(GPSD)能保住知识却无法重塑几何、随时间衰减;全量微调能重塑几何却覆写知识;LoRA/adapter 冻结主干、剩余自由度太小;数据回放会过拟合陈旧噪声。KGD 的切入点是用‘分离读写所有权’一次性消除每个失败成因——它预训练一个干净几何、每日刷新它、避免梯度冲突、端到端地写出任务几何、且不需要历史数据回放。
核心方法
KGD 的整体思路是:预训练知识与任务几何不必竞争同一个表示,它们可以作为两层、由不同 owner 各自持有的参数共存——编码器持续刷新行为几何,任务学习者在其上正交地写出任务几何。技术上分两步。先回答‘学什么’:用 Behavioral Multi-Token Prediction(BMTP)预训练编码器,只监督在协同轴(LightGCN 物品共现图邻近度)或语义轴(预计算文本 embedding 余弦相似度)上相关的未来 item,构建一个干净的 base 几何。再回答‘怎么迁移’:把任务学习者与编码器通过两个单向只读接口耦合——在 embedding 层用 Anchored Calibration Residual(ACR)叠加正交残差,在表示层用 stop-gradient 的只读交叉注意力读取编码器隐状态。这样任务梯度永远到不了编码器,两层几何互不干扰。
核心创新点是‘分离读写所有权 + 残差锚定在预训练几何上’。作者先用三个观察严格推导出 ACR 的形式:观察一,若任务与预训练只差一个温度 $\tau$,则最优校正就是全局缩放 $e_i^{task} = \alpha e_i^{pre}$,$\alpha=1/\tau$;观察二,真实任务(CTR 用 BCE、检索用难负例)对几何是方向依赖的形变而非缩放;观察三,形变不能抵消预训练方向,否则读取时信号被消掉。把‘超越标量的自由度’和‘保留预训练方向’合起来,唯一解就是残差与 $e_i^{pre}$ 正交:标量 $s_k$ 保留锐化方向,低秩残差 $\Delta e_i^{(k)} \perp e_i^{pre}$ 写任务形变。这与 LoRA 本质不同——LoRA 残差无正交约束、会与冻结主干方向冲突,自由度也太小;而冻结迁移根本没有输入层几何自由度。
方法步骤详情
KGD 的完整训练-服务流程如下。第一步预训练:用 BMTP 目标在全部用户行为序列上自回归预训练编码器 Transformer。BMTP 对每个位置 $t$ 和每个轴 $a\in\{col,sem\}$,只保留相似度超阈值的最近后续 item,集合定义为 $S_t^a = \{i_j : j=\min\{j'>t, \text{sim}_a(i_t,i_{j'})\geq\tau_a\}\}$,阈值为 $\tau_{col}=0.5$、$\tau_{sem}=0.8$,损失为 $\mathcal{L}_{BMTP} = -\sum_t\sum_a\sum_{i_+\in S_t^a} \log\frac{\exp\langle h_t, e_{i_+}\rangle}{\sum_{i'}\exp\langle h_t, e_{i'}\rangle}$。第二步每日刷新:每天先用当天新数据对编码器做一遍 pass 刷新 $\theta^{(\ell)} \to \theta^{(\ell+1)}$。第三步任务训练:冻结编码器参数,运行‘编码器+学习者’组合图,只更新学习者。学习者先用 ACR 重塑输入 embedding 得 $\tilde{H}=\text{Trans}_{enc}(\text{ACR}(E))$,再用只读交叉注意力 $Q=W_Q\rho, K=W_K\text{sg}(\tilde{H}), V=W_V\text{sg}(\tilde{H})$ 读取。reader token $\rho$ 按任务实例化:检索用用户侧向量,排序用候选侧 token。第四步服务:学习者独占独立的注意力/FFN 和低维 item embedding,稠密参数约翻倍、稀疏 embedding 增 20%,单请求延迟与单骨干基线持平(因为 query token 本就要过共享编码器)。
技术新颖性
技术新颖性体现在三处。第一,BMTP 把‘去噪’做进了预训练目标本身(用协同/语义相似度过滤),而非像注意力去噪那样事后降权、或像 LLM 重写那样逐序列重标——这两种相似度都离线预算并缓存,不增加每序列的模型推理开销,可在十亿级日志上反复刷新。第二,ACR 的正交约束是从‘自由度+保留方向’两个需求数学推导出的唯一形式,并通过正则项 $\mathcal{L}_{orth} = \frac{1}{|B|}\sum_{i\in B}\cos^2(\Delta e_i^{(k)}, e_i^{pre})$ 实现,使任务几何‘锚定’在预训练 embedding 上而非绝对坐标,因此刷新只移动基底、残差依然有效——这是刷新与适应能独立的关键。第三,只读交叉注意力 + 分离骨干让任务梯度物理上无法触及编码器,使任务几何端到端地由任务学习者拥有,而非借用一个为‘转移建模’特化的骨干。三者合起来实现了‘预训练几何’与‘任务几何’作为正交层的共存。
实验结果
论文从公开基准、工业流和线上 A/B 三个层面验证。公开基准(8 个 Amazon-2023 数据集,leave-one-out,报告 NDCG@50 和 Recall@50):KGD(BMTP)在全部 8 个数据集上取得最佳,相对最强已发表基线提升 4–12%(如 Arts NDCG@50 从 0.0354 提升到 0.0380,提升 7.6%;Recall@50 提升 8.7%;Office 提升约 13.6–13.9%;Toys 提升约 9.3–12.0%)。关键发现是 BMTP 的增益高度依赖迁移方式:在全量微调(TE&FT/TA&FT)下,BMTP 相对 NTP 的增益缩小甚至反转(如 Phones NDCG@50 在 TE&FT 下 −8.2%),因为任务梯度把 BMTP 装入的结构擦除;而在冻结迁移(TE&FE/TA&FE/TA&FD/TA&FA)下增益大且稳定,TA&FD/TA&FA 下甚至达两位数。这同时证明了 BMTP 确实编码了可迁移知识,且需要不被覆写的迁移方式。控制预训练目标后,KGD 仍比最强共享参数基线(用 BMTP)在每个数据集上多 0.4–7.0%。工业流(28 天,约 130 亿样本,OneRank 骨架):KGD 在 click AUC/GAUC、order AUC/GAUC 全部最优(click AUC 0.7867、click GAUC 0.7826、order AUC 0.9015、order GAUC 0.8477)。所有权而非调度是决定因素:TA&FT 在 S3(每日刷新)下从 0.7852 掉到 0.7837,TA&FE 几乎不动 0.7841——共享参数上刷新与适应互相抵消;而 KGD 解耦后达 0.7867。移除 ACR 和只读编码器后 S3 退化为 0.7785,甚至低于 Scratch 0.7806。Buffer replay(0.7732)比 Scratch 还差,印证稀疏 embedding 多轮过拟合问题。90 天轨迹显示冻结迁移随时间衰减、KGD 全程稳定。消融显示 BMTP 两轴互补:去掉协同过滤在头部用户损失 0.5% AUC,去掉语义过滤在尾部用户损失 1% AUC;去掉 ACR 全面下降;ACR 放回共享骨干(无论冻结还是微调)仍劣于完整 KGD;把共享骨干参数量对齐到 KGD 仍落后、甚至在稀疏公开集上回归。线上 A/B(Shopee 首页搜索,10% 对 10%,逾千万用户/桶):GMV/用户 +1.75%、广告收入 +1.53%、CTR +0.95%、CVR +0.72%,GMV 与收入达 $p<0.01$ 显著;回滚一周 GMV 降 1.21%,反向不对称反映 GMV 高方差而非不稳定。训练成本每日从 1 小时增至 2 小时(同 A100 数量),延迟维持 120ms(A30),内存因只读学习者翻倍。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 序列推荐(Amazon 公开基准,NDCG@50) | NDCG@50 | KGD+BMTP 在 8 个数据集上均最优,如 Arts 0.0380、Office 0.0352、Toys 0.0365、Games 0.0788 | 最强已发表基线(GPSD/SORT/PeterRec 等冻结迁移,NTP) | 相对最强已发表基线 +4.2%–13.9%(如 Office +13.9%,Toys +12.0%) |
| 序列推荐(Amazon 公开基准,Recall@50) | Recall@50 | KGD+BMTP 全数据集最优,如 Arts 0.1099、Office 0.0938、Games 0.2244 | 最强已发表基线 | +1.5%–13.6%(如 Office +13.6%) |
| 工业流式排序 click AUC(Shopee 首页搜索 28 天) | click AUC | KGD 0.7867 | Scratch 0.7806、TA&FE(S3) 0.7841、LoRA 0.7818、KGD 去掉 ACR/RO 0.7785 | 相对 Scratch +0.78%,相对 GPSD(TA&FE S3) +0.33% |
| 工业流式排序 order AUC | order AUC | KGD 0.9015 | Scratch 0.8941、Buffer replay 0.8813 | 相对 Scratch +0.83%,相对 Buffer replay +2.3% |
| 线上 A/B 业务指标(Shopee 首页搜索,两周) | GMV per user | KGD 相对生产 OneRank +1.75% | 生产 OneRank(持续训练 6+ 月) | +1.75%(p<0.01),广告收入 +1.53%、CTR +0.95%、CVR +0.72% |
局限与改进
作者明确声明了研究范围:本文聚焦于从行为序列直接学习协同关系与序列转移模式的经典深度学习推荐器,而非从文本蒸馏知识、靠提示或参数高效微调的 LLM4Rec,所以 LLM4Rec 技术可能不在本文方法范围内。线上 order 侧增益(CVR +0.72%)相对点击侧(CTR +0.95%)偏小,作者解释这是因为 order 标签稀疏、预训练更难捕捉,预训练对稀疏转化信号的提升有限。我自己观察到几点:语义 BMTP 依赖物品的 title/category/shop 文本元数据,对缺乏文本信息或元数据质量差的场景(如加密特征数据集 Criteo)无法适用——作者也承认多数公开工业数据集因特征加密而不适合验证 KGD。BMTP 的两个阈值 $\tau_{col}, \tau_{sem}$ 需要按域校准(论文给出 $\tau_{col}\in[0.4,0.6]$、$\tau_{sem}\in[0.8,0.9]$ 的经验范围,但 Software 这种小目录高密度数据集上 BMTP 直接预测反而不如 NTP)。此外工业部署的很多细节(完整特征、词汇规模、具体硬件)因商业原因未完全披露。
独立分析的弱点
第一,对文本元数据的强依赖。语义轴需要预计算的文本 embedding(论文用 Qwen3-Embedding),如果物品缺乏高质量 title/category/shop 文本,或文本与实际行为弱相关,语义过滤会失效。改进方向:可以引入多模态 embedding(图像、价格、属性)替代或补充纯文本相似度,扩大语义轴的适用范围。第二,阈值敏感性。$\tau_{col}, \tau_{sem}$ 需按数据集校准,论文虽然证明可用‘预训练模块直接性能’作为下游性能代理来简化调参,但对新业务仍需一轮离线扫描。改进方向:可设计自适应阈值(按相似度分布分位数而非固定值),或可微的软阈值门控。第三,冷启动物品问题。新物品既无共现图邻居也无足够行为,BMTP 对其几乎无监督,ACR 低秩残差也因冷启动难以学到。改进方向:结合内容-行为联合 embedding 的零样本初始化,或对冷启动物品用元学习快速估计 ACR 残差。第四,参数与显存翻倍。稠密参数约翻倍、稀疏 embedding 增 20%、显存因只读学习者翻倍,虽然延迟持平,但对资源受限的小团队仍是负担。改进方向:对任务学习者做参数共享或更激进的低秩压缩(如把 ACR 与只读注意力进一步统一到一个低秩框架)。第五,正交约束靠正则近似实现而非硬约束,存在轻微违背时几何会被污染的风险,可考虑用投影法做硬正交。
未来方向
作者明确提出的研究范围限定暗示了延伸方向:把知识-几何解耦思想扩展到 LLM4Rec,即对那些从文本蒸馏知识、靠提示/PET 适配的推荐器,研究其预训练知识(文本语义)与任务几何是否也能用类似的正交层解耦、是否也能受益于每日刷新。基于本文成果可延伸的方向包括:一是把 KGD 应用到检索/重排/跨域推荐之外的更多任务(如多模态搜索 MUSE 类框架),验证解耦所有权的普适性;二是把‘预训练几何’与‘任务几何’的分层思想推广到多任务学习,每个任务拥有独立 ACR + 学习者、共享一个刷新编码器,论文 Table 8 已初探任务独立参数化带来增益(click AUC 0.7867→0.7883);三是探索更高效的刷新策略(如增量预训练、稀疏刷新)以进一步降低每日 2 小时的训练成本;四是在线学习场景下研究 ACR 残差与编码器的异步刷新节奏对长期稳定性的影响。
复现评估
复现性整体较高。论文提供了核心实现的开源仓库 https://github.com/FuCongResearchSquad/KGD4REC。公开基准部分完全可复现:8 个 Amazon-2023 数据集用 5-core 与 leave-one-out 划分,骨干用公开可评的 ManCAR,超参明确(2 层 Transformer、hidden/embedding 维 256、2 注意力头、序列长 50、Adam 学习率 $1\times10^{-3}$、batch 1024、early stopping patience 3),硬件为单卡 A800 80GB。BMTP 的两个阈值 $\tau_{col}=0.5,\tau_{sem}=0.8$、ACR 低秩维度 $r=d/4$ 都明确给出,且论文证明预训练模块直接性能可作为下游代理来简化调参。难点在于:协同轴需要先用 LightGCN 学物品图 embedding、语义轴需要用 Qwen3-Embedding 生成文本 embedding 并缓存,这两个预处理流程需要复现;工业部分因商业原因无法完全复现(约 130 亿样本、十亿级 item、千万级 user、500+ 特征、OneRank 骨架、A100 训练、A30 服务的具体配置未完全披露),但作者给出了足够的统计量(点击率约 7.5%、order 率约 0.41%)和成本数字(每日 2 小时训练、120ms 延迟)便于估算。算力门槛中等:公开实验单卡 A800 即可,工业级复现则需要大规模 GPU 集群。
论文图表
包含两个子图:(a) 是一个用户序列里多个 item 预训练语义 embedding 的余弦相似度矩阵热力图,对角线上每个兴趣会话内部相似度高(深色块),但跨会话边界(齿轮↔裤子)相似度几乎崩溃为白色,说明 NTP 仍会监督这种无关相邻对;(b) 是预训练梯度与任务梯度在同一参数组上的余弦相似度,数值接近零甚至为负,证明两个目标在共享参数上相互冲突。
这张图是整篇论文动机的视觉锚点——(a) 直观论证了‘相邻≠依赖’这一 Q1,(b) 用数据论证了‘知识与几何在共享参数上冲突’这一 Q2,读懂它就抓住了 KGD 两个核心问题的来源。
测量工业流上每日 item-ID 与 user-ID 交互分布的 Jensen-Shannon 散度:既测相邻天之间的 JSD(item 约 0.19–0.20、user 约 0.38–0.39),也测相对初始日的 JSD(随天数持续上升到 item 约 0.24、user 约 0.42),证实分布漂移持续累积、从不饱和。
这张图提供了‘分布持续漂移’这一现实前提的量化证据,是‘预训练必须每日刷新而非一次定型’这一核心论点的经验基础。