← 返回 2026-08-25

迈向十亿级容量的用户表征学习致密化定律 Towards a Densing Law for User Representation Learning at Billion-Scale Capacity

Bin Dou, Junru Zhang, Zhaoyi Yuan, Wuliang Huang, Letian Gong, Baokun Wang, Huan Li, Yu Cheng, Weiqiang Wang 📅 2026-08-24 👍 27 2026-08-30 18:30
RQ-VAE 工业大规模 推荐系统 用户表征学习 缩放定律 自适应量化 行为分词

发现原始行为数据扩展的饱和墙,提出行为致密化定律与自适应分词ALGN

前置知识

InfoNCE 对比学习

一种自监督表征学习目标:把同一样本的两个视图(这里是用户过去行为的编码 $e_b$ 和未来行为文本的嵌入 $e_q$)在嵌入空间拉近,把批内其他样本对推远,损失形如 $\mathcal{L}_{CP}=-\frac{1}{B}\sum_i \log \frac{\exp(\text{sim}(e_b^i,e_q^i)/\tau)}{\sum_j \exp(\text{sim}(e_b^i,e_q^j)/\tau)}$,温度 $\tau$ 可学习。

本文的预训练框架、缩放实验和下游评估全部构建在该目标之上;理解“预训练损失持续下降但下游精度不再提升”的损失-质量脱钩现象,必须先懂这个目标度量的是什么。

RQ-VAE 残差量化自编码器

把连续向量变成离散码的分词器:第 1 层码本量化输入得到码字,第 2 层量化剩余残差,逐层递归 $r^{(m+1)}=r^{(m)}-c^{(m)}$,最终用 $M$ 个码字组合(Semantic ID)近似原向量。前面的码本捕获粗粒度语义,后面的码本修复细节。

它是本文的“密度算子”:致密化定律描述的就是 RQ-VAE/VQ-VAE/SARQ 这类分词器的最优容量(码本大小 $K$、层数 $M$、维度 $d$、token 长度 $H$)如何随数据规模扩展,ALGN 也是在残差量化架构上改造的。

Semantic ID 行为分词

把用户行为(如支付账单文本)压缩成离散 token 序列作为用户的有效输入单元,替代动辄上千 token 的原始文本。语义 ID 具有组合性:不同层码字的组合可以复用共享结构,用有限码本表达海量行为模式,TIGER 等生成式检索工作即采用此思路。

论文的核心主张是“分词化能突破原始数据缩放墙”,整篇的实验对比都是原始文本序列 vs 语义 ID 序列,理解这一表示形式是读懂 Figure 7、8 的前提。

缩放定律(Scaling Law)

描述模型性能与数据量、参数量、算力之间幂律关系的经验规律,常在对数-对数坐标下呈线性。工业推荐系统中的缩放研究(如 Meta 的Scaling 定律系列)考察用户数、序列长度、模型大小对下游指标的影响。

本文前半部分是对“原始数据缩放定律”的实证(发现饱和墙),后半部分提出的致密化定律 $\ln C^*(s)=\beta+\alpha\ln(s/s_0)$ 就是缩放定律思想在“分词容量配置”维度上的类比与推广。

Pareto 最优与约束优化

在效用与成本两个冲突目标间找不可能同时改进的解集,常写成拉格朗日形式 $\arg\max_\phi[U(\phi,s)-\lambda C(\phi)]$;由于训练有随机噪声,实践中更稳健的做法是固定效用约束 $U\ge U^*-\epsilon$ 再最小化成本。

致密化定律的数学定义就建立在这个框架上:每个数据规模下取“最小充分分词容量”,其解轨迹构成定律;不看懂这步形式化就无法理解斜率 $\alpha$ 是怎么拟合出来的。

线性探测(Linear Probing)

评估预训练表征质量的协议:冻结预训练编码器,只在其输出的嵌入上训练一个轻量线性分类器 $y=\mathbb{I}[W f_\theta^*(u)+b>0.5]$,用 AUC/KS/Accuracy 衡量嵌入本身的判别力,排除下游微调对结果的干扰。

本文所有缩放结论都基于这套协议(50 个分类数据集 + 22 个文本检索 + 22 个 U2U 检索场景取平均),保证不同缩放配置之间可比。

研究动机

工业界用户表征学习惯用三条路扩容:加用户数、拉长行为时间窗、加大模型。作者在支付宝 PayBill 生产数据上的系统实验表明三条路都会撞上“原始行为缩放墙”:固定 $D=180$ 天、编码器 0.1B 参数时,用户数 $N$ 从 0.01B 涨到约 0.03B,AUC/KS/Acc 三项指标明显上升,但继续涨到 0.1B 几乎不再提升;固定 $N=0.1$B 时,时间窗 $D$ 从 30 天到 60 天有清晰收益,翻倍到 120 天收益却微弱;最反直觉的是模型维度——参数从 0.05B 加到 0.2B,分类 AUC 从 73.00% 升到约 73.9%,继续加到 0.4B 训练损失仍在下降、下游精度却停在 73.92%,出现“损失-质量脱钩”。根源在于行为日志由日常习惯主导:数据量快速增长的同时,任务相关的新信息增长极慢,多出来的算力都在拟合重复、低信息的事件。

本文的目标是本文要把“堆数据量”的范式换成“提信息密度”:在固定数据与算力预算下,让每个有效输入单元携带更多下游相关信号。具体拆成三个研究问题:RQ1——分词化(tokenization)能否缓解乃至突破原始数据的缩放墙;RQ2——分词容量配置(码本大小 $K$、残差层数 $M$、码向量维度 $d$、输出 token 长度 $H$)应当如何随数据规模定量扩展,而不是靠人工拍参;RQ3——能否把尺度级的最优配置进一步下沉为实例级的容量分配方法。最终产出两个东西:一个可以用轻量统计量(如文本嵌入的近邻距离)从数据规模预估最优配置的“行为致密化定律”,以及据此设计的自适应长度分词方法 ALGN。

与已有工作不同的是,已有工作各占一角却没打通:工业缩放研究(Ardalani et al. 2022、Shen et al. 2025 等)只刻画原始数据与模型规模的缩放行为,确认了边际收益递减但没给出解法;行为分词工作(VQ-VAE、RQ-VAE、TIGER、U2QT 等)证明了离散 token 对用户建模有效,但都在选定数据规模下使用人工固定的分词配置;自适应量化研究(Huijben et al. 2024、Seo & Kang 2024 等)做输入级长度分配,却默认最大可用容量已经给定。没有任何工作定量回答“数据规模变大时,最优分词容量沿什么轨迹增长”。本文用三方法(RQ-VAE/VQ-VAE/SARQ)× 三数据源(PayBill/SPM/MiniProgram)× 三任务的交叉设计首次拟合出容量-规模幂律,并给出斜率与数据内在多样性 $U_d$ 的定量关系(Table 1 显示其在四个维度上的覆盖是唯一的)。

核心方法

整体路线是“先诊断、再开方、后下沉”。第一步建立参照系统:用行为-文本对比学习做自监督预训练,把用户过去 $D$ 天行为按时序切分,过去段经 Transformer 编码器得 $e_b$,未来段套文本模板后由冻结的 Qwen3-Embedding(加 rank-16 LoRA)编码得 $e_q$,用 InfoNCE 对齐;下游用冻结编码器做线性探测分类、零样本文本检索和少样本 U2U 检索。第二步沿 $N$、$D$、$P$ 三轴做缩放实验,实证原始数据缩放墙。第三步引入 RQ-VAE 残差量化作为密度算子:多源行为先映射为连续嵌入,局部聚合成 $H$ 个隐向量($H$ 远小于原始事件数),逐层残差量化成离散语义 ID,再用同一个编码器、同一个对比目标训练,保证收益严格来自输入致密化而非架构变化。第四步把“每个规模下选最小充分分词配置”形式化为带效用约束的 Pareto 优化,在 log-log 空间拟合出幂律轨迹,并用三种分词方法、三种数据源、三类任务验证其普适性。第五步把定律从尺度级下沉到实例级,提出 ALGN 自适应决定每条行为记录需要几层量化码。

核心洞察是:限制用户编码器表达力的不是模型容量,而是原始行为输入的信息密度。作者呼应语言模型的 Densing Law,定义行为密度 $\rho^*(s)=\tilde{C}_{raw}(s)/C^*(s)$——达到同样下游效用时原始建模成本与致密化表示成本之比,并把行为致密化定律写成 $\ln C^*(s)=\beta+\sum_i\alpha_i\ln(s_i/s_{i,0})$(标量形式 $\ln C^*(s)=\beta+\alpha\ln(s/s_0)$):最优分词容量随数据规模呈幂律增长,斜率 $\alpha$ 由数据内在多样性 $U_d$ 与分词方法表达形式 $E_\phi$ 共同决定,实验上 $\alpha\propto U_d^2$,其中 $U_d$ 用 LLM 文本嵌入的 Mean k-NN 余弦距离度量。与已有工作的本质区别在于:不是把分词器当成超参固定的压缩工具,而是把“容量配置如何随数据扩展”本身变成可拟合、可预测、可跨任务迁移的定量规律,让从业者只需算一个轻量的 $U_d$ 就能预估千亿 token 规模下的码本配置。

方法步骤详情

① 预训练:把用户 $D$ 天行为切成过去段与未来段,过去段经 Transformer 编码为 $e_b$,未来段套模板(如“用户购买 {items} 金额超过 {num} 元,支付{status}”)由冻结的 Qwen3-Embedding 加 rank-16 LoRA 编码为 $e_q$,用 InfoNCE(式 1)对齐。② 缩放诊断:在 $N\in[0.01B,0.1B]$、$D\in[30,270]$ 天、$P\in[0.05B,0.4B]$ 网格上训练并按统一协议评估。③ RQ-VAE 分词:连续嵌入序列 $X_n$ 聚合为 $H\ll L_n$ 个隐向量 $z_{n,h}$,第 $m$ 层码本 $C^{(m)}$ 选最近码字并更新残差 $r^{(m+1)}=r^{(m)}-c^{(m)}$,输出 $H$ 个语义 ID;以重建损失加 commitment 损失(式 7)训练后冻结分词器,再用同一对比目标训练编码器。④ 定律推导:定义容量 $C_{tok}=HM\log K+\eta HMd$(式 11),用约束 $U(q_\kappa)\ge U^*(N,D)-\epsilon$(式 13)稳健地找最小充分配置;假设效用前沿 $U(C,s)=U_\infty(s)-a(s)C^{-b}$,一阶条件解出幂律(式 17-21);多样性按式 23 用 $U_d=\frac{1}{M}\sum_i\sum_{j\in kNN(i)}d(i,j)$ 量化。⑤ ALGN:每层计算残差范数 $R_l=\|r_{l-1}-e_{l,m}\|_2$ 与累计码不确定性 $E_l=-\sum_k\log p(m_k|m_{<k})$,门控概率 $g_l=\sigma(sp(w_R)R_l+sp(w_E)E_l-sp(w_C)c_l+b)$,首个 $g_l\le\theta$ 的层即停止(式 27);训练损失为激活层重建损失加长度分布 KL 正则(式 28),先验取几何分布 $\gamma=0.3$。

技术新颖性

新颖性有三层。问题层:首次提出并系统量化“分词容量配置随数据规模的扩展规律”,此前的分词方法都假设容量给定,自适应量化也只做输入级分配。方法论层:把最小充分容量写成带 $\epsilon$ 松弛的约束式 Pareto 优化(而非直接优化拉格朗日),规避了随机训练噪声下连续优化的不稳定性,从而能从离散配置点上稳健拟合幂律;并给出斜率的可解释性——$\alpha\propto U_d^2$,三个数据源的斜率比 1:1.15:0.92 与 $U_d$ 比 1:1.07:0.96 的平方在 $10^{-2}$ 精度内吻合。方法设计层:ALGN 不是按先验统计截断长度(启发式基线在消融中 AUC 反而降到 74.43%),而是用残差信息量、量化不确定性、边际成本三信号联合门控,且用长度分布 KL 正则而非逐样本长度惩罚来注入行为长尾先验,把尺度级定律转译成了实例级机制,并将定律斜率从 RQ-VAE 的 0.7686 压到 0.5893。

Pretraining framework for general-purpose user representation
Figure 2: Pretraining framework for general-purpose user representation
Three downstream tasks for user representation evaluation
Figure 3: Three downstream tasks for user representation evaluation
Overview of the RQ-VAE based tokenization method used for behavioral densing
Figure 6: Overview of the RQ-VAE based tokenization method used for behavioral densing
Adaptive variable-length tokenization method allocates more codes to high-information behavioral periods
Figure 10: Adaptive variable-length tokenization method allocates more codes to high-information behavioral periods

实验结果

逐条看实验。① 用户数缩放(Figure 4):$N$ 从 0.01B 到约 0.03B 三项指标上升,0.03B 之后到 0.1B 趋于平坦,饱和阈值约 0.03B 用户。② 时间窗缩放(Figure 4):$D$ 从 30 到 60 天有明确收益,60 到 120 天翻倍输入收益微弱。③ 模型缩放(Figure 5):参数 0.05B→0.2B 分类 AUC 73.00%→约 73.9%,0.2B→0.4B 精度停在 73.92% 而训练损失持续下降,文本检索与 U2U 检索同样在约 0.2B 后饱和(57.93%→57.95%→57.96%、70.16%→70.16%→70.16%)。④ 分词化收益(Figure 7、8):约 $D\approx64$ 天、$N\approx1.2\times10^7$ 处 tokenized 曲线反超 raw,此后差距扩大;270 天窗口下 tokenized AUC 74.78% vs 原始 73.96%,且在 $10^{10}$–$10^{13}$ token 数据量与对应 PFLOPs 算力上三个任务趋势一致。⑤ 定律拟合(Figure 9):PayBill 上 RQ-VAE 斜率 0.75–0.79(如分类任务 $\ln C=0.7686\ln s-3.0846$),VQ-VAE 1.36–1.62,SARQ 0.60–0.68;同一方法在三类任务上斜率在数值误差内一致;三数据源斜率比约 1:1.15:0.92,与 $U_d$ 比 1:1.07:0.96 的平方吻合,验证 $\alpha\propto U_d^2$。⑥ ALGN(Table 3、4):AUC 76.43%、KS 43.31%、Acc 83.52%,较最强基线 SARQ 提升 1.07%/2.03%/0.36%,SID 容量占用降至 63.47%(相对 RQ-VAE 省 36.53%、相对 SARQ 省 13.23%);消融显示去掉不确定性信号容量升至 77.83%、去掉残差信号同等退化、几何先验正则优于随机分布正则(容量再省 6.68%);ALGN 还把定律斜率降到约 0.59(Figure 11)。

Comparison of related work across the dimensions considered in this study
Table 1: Comparison of related work across the dimensions considered in this study
Notations, corresponding descriptions, and key statistics
Table 2: Notations, corresponding descriptions, and key statistics
Comparison of different tokenization methods
Table 3: Comparison of different tokenization methods
Ablation study on each component of ALGN
Table 4: Ablation study on each component of ALGN
Tokenized representations outperform raw sequences at matched data scales with the gap widening where raw modeling saturates
Figure 7: Tokenized representations outperform raw sequences at matched data scales with the gap widening where raw modeling saturates
Downstream task performance with data size & training computes scaling
Figure 8: Downstream task performance with data size & training computes scaling
Behavioral Densing Law across different data sources and tokenization methods, derived from three tasks
Figure 9: Behavioral Densing Law across different data sources and tokenization methods, derived from three tasks
Effect on densing law for ALGN under classification task
Figure 11: Effect on densing law for ALGN under classification task
查看结构化数据
任务指标本文基线提升
分类(线性探测,PayBill,180天/0.1B用户) AUC (%) 76.43(ALGN) 75.36(SARQ)/ 74.56(RQ-VAE) +1.07 / +1.87
分类(线性探测) KS (%) 43.31(ALGN) 41.28(SARQ)/ 39.02(RQ-VAE) +2.03 / +4.29
分类(线性探测) Accuracy (%) 83.52(ALGN) 83.16(SARQ)/ 82.44(RQ-VAE) +0.36 / +1.08
SID 表示容量效率 容量占用 (%)(越低越好) 63.47(ALGN) 100.00(RQ-VAE/RQ-Kmeans)/ 76.24(SARQ) 节省 36.53 / 13.23
长序列建模(270天窗口,分类) AUC (%) 74.78(Tokenized Data) 73.96(Raw Data) +0.82,且 raw 在长窗口已饱和
致密化定律斜率(PayBill,分类任务) α = d ln C* / d ln s 0.5893(ALGN) 0.7686(RQ-VAE)/ 1.4196(VQ-VAE) 斜率更低:容量需求随数据规模增长更慢

局限与改进

作者承认两点:实验只覆盖单一数据模态(支付/行为文本),定律对视频消费等其他行为模态是否成立未经验证;全部结论来自单一平台的生产数据,在公开基准上的鲁棒性仍在评估中。我补充几点观察:其一,效用松弛 $\epsilon$、停止阈值 $\theta$、几何先验 $\gamma=0.3$ 都是关键超参,论文未做敏感性分析,落地时配置选取仍有不确定性;其二,$\alpha\propto U_d^2$ 是经验拟合而非推导结论,且 $U_d$ 依赖 Qwen3-Embedding 这一特定度量,换嵌入模型是否稳定未知;其三,所有下游指标都在 50/22/22 个场景数据集上取平均,掩盖了低活跃、冷启动用户——这类用户信息本来就少,可能被分词或几何先验过度压缩,论文缺少分层分析;其四,分词器先训练后冻结,行为分布随时间漂移时码本和容量配置都需重训,定律“一次性指导配置”的价值会打折扣。

独立分析的弱点

弱点一:分词器与下游目标脱钩。RQ-VAE 以重建为目标训练,保留的未必是任务相关信息,致密化收益部分依赖对比目标碰巧筛掉冗余。改进方向:在码本训练中引入下游任务的互信息估计或对抗信号,做任务感知量化。弱点二:ALGN 的门控权重 $w_R,w_E,w_C$ 全局共享,相当于对所有用户用同一条边际效用曲线,而定律本身说明不同数据源、不同人群的 $\alpha$ 不同,长尾活跃用户可能被统一的几何先验($\gamma=0.3$)过度截断。改进:按用户活跃度分桶做分组门控,或把先验改为随 $U_d$ 自适应。弱点三:交叉点位置($D\approx64$ 天、$N\approx1.2\times10^7$)是数据相关常数,换平台需要重跑昂贵的缩放网格实验。改进:用 $U_d$ 先验冷启动预估配置,再用小规模实验在线校准 $\beta$。弱点四:评估只报告平均指标,无法判断致密化对不同信息量用户的异质影响。改进:报告按活跃度/熵分层的指标,并检查语义 ID 碰撞对低信息用户的伤害。

未来方向

作者提出的方向:把信息密度当作与模型容量、数据量并列的一等设计目标;发展多模态密度估计(视频消费等模态);夯实数据致密化的理论基础;在公开基准上检验定律。基于本文成果可延伸的:利用 $\alpha\propto U_d^2$ 关系做跨平台迁移——只需计算轻量的文本嵌入近邻距离即可预估最优配置,省去缩放网格实验;把“原始文本 vs 离散 token”的密度权衡思路引入 LLM 预训练数据筛选与课程设计;研究分词器与下游编码器联合训练的端到端致密化,替代目前先冻结再训练的两阶段方案;在流式场景对容量配置做在线更新以应对行为分布漂移;ALGN 的边际效用门控思想也可迁移到 LLM 的 KV-cache 压缩与视觉 token 剪枝,本质都是“只有当边际信息量超过边际成本时才保留下一个单元”。

复现评估

完整复现难度高,但趋势性验证可行。最大障碍是数据:结论建立在支付宝 PayBill/SPM/MiniProgram 亿级用户生产数据上($N$ 最大 2B、每用户约 2200 个行为文本 token、每天 0–10 条事件),未开源,50 个分类 + 44 个检索下游数据集也不可得,公开基准验证仍在进行中。方法可复现性尚可:RQ-VAE/VQ-VAE/SARQ 均有公开实现,Qwen3-Embedding 开源,预训练框架沿用作者此前工作(Dou et al., 2025),ALGN 的公式(式 24–29)与超参($\gamma=0.3$、LoRA rank 16、长度阈值 $\theta$)描述完整。算力方面,编码器 0.05B–0.4B 参数,训练算力横跨约 $10^5$–$10^9$ PFLOPs(Figure 8),拟合定律还需在 $(N,D)$ 网格上训练数十个模型,中小团队难以完整复制;但在开源行为数据集(如电商评论、公开推荐数据)上小规模验证“交叉点存在性 + ALGN 容量节省”是现实的。论文未提及代码发布。