xHC:扩展型超连接——突破残差流扩展的 N=4 上限 xHC: Expanded Hyper-Connections
首个突破N=4的超连接法,以时间特征增强与稀疏残差更新让大N扩展成为实用缩放轴
前置知识
残差连接 (Residual Connection)
Transformer 中跨层传递 token 表示的机制,即 $x_{l+1} = x_l + F(x_l)$,使信息能沿恒等通路无衰减地传到深层。标准做法只维护单条残差流,缺乏对跨层信息流的可学习控制。
xHC 的全部工作都是把这条单流改造成 $N$ 条并行流,理解单流残差的局限才能理解扩张动机。
超连接 Hyper-Connections (HC) 与流形约束 mHC
HC 把残差流扩展为 $N$ 条并行流,每层引入预映射 $H^{pre}\in\mathbb{R}^{1\times N}$、后映射 $H^{post}\in\mathbb{R}^{N\times 1}$、残差映射 $H^{res}\in\mathbb{R}^{N\times N}$ 三个可学习映射:$X_{l+1}=H^{res}_l X_l + H^{post}_l F(H^{pre}_l X_l)$。mHC 通过 Sinkhorn 归一化把 $H^{res}$ 投影到双随机矩阵的 Birkhoff 多面体上,保证深度方向信息稳定传播,是当前最强的 HC 变体。
xHC 直接建立在 mHC 的稳定多流公式之上,N=4 既是 mHC 的标准配置,也是 xHC 试图突破的上限。
Sinkhorn 归一化与双随机矩阵
Sinkhorn-Knopp 算法通过迭代地按行、按列归一化,把任意非负矩阵投影到行和列和均为 1 的双随机矩阵集合上。在 mHC 中用它约束 $H^{res}$,使跨层复合映射 $\prod H^{res}_l$ 既不放大也不衰减信号,保持恒等映射性质。
xHC 仍沿用 Sinkhorn,只是把它作用在 $k$ 个活跃流上的 $k\times k$ 子矩阵,理解归一化才能理解稀疏更新为何不破坏稳定性。
混合专家 Mixture-of-Experts (MoE)
一种计算稀疏化方法:每个 token 只被路由到部分专家(前馈网络),从而把总参数量与单 token FLOPs 解耦。本文用 DeepSeekMoE 风格主干:144 个专家、top-8 路由、SwiGLU FFN,分别在 18B(激活 1.7B)和 28B(激活 2.7B)规模上验证。
论文的全部主实验都在 MoE 上完成,且稀疏专家与 xHC 的稀疏残差流是两个正交的稀疏维度,理解 MoE 才能理解评估场景。
因果深度卷积与 Gram-Schmidt 正交化
因果深度卷积只沿 token 维度、逐通道地融合历史邻居 $g_j[t]=\sum_i w_j[i]\odot out[t-i]$,保持自回归顺序、开销极小。Gram-Schmidt 正交化则逐 token 地从卷积分支中消除与原始输出平行的分量 $v_{j+1}=g_j-\sum_i \frac{\langle g_j,v_i\rangle}{\langle v_i,v_i\rangle}v_i$,使增强后的写回基更不冗余。
时间特征增强正是用多尺度因果卷积(核 $\{4,8,12\}$)配合正交化来丰富写回信号,是 xHC 解决信息瓶颈的核心手段。
Top-k 路由与固定+路由混合方案
稀疏路由先对每个候选流打分 $s=\sigma(\tilde{x}_l W_r)$,再用 TopK 选出活跃子集。xHC 采用固定+路由混合:$m$ 条流始终活跃(权重恒为 1),其余 $k-m$ 条由 TopK 选出,既保证稳定写回通路又保留自适应能力,配合 sigmoid 避免 softmax 的赢家通吃。
xHC 的稀疏残差架构完全依赖这套路由决定哪些流被更新,理解它才能看懂算法 1 与消融实验里 k、固定流数、sigmoid 的作用。
研究动机
超连接(HC)及其稳定变体 mHC 把残差流从单条扩展为 $N$ 条并行流,在 $N$ 从 1 到 4 时带来可观收益,似乎是一条独立的缩放轴。但所有 HC 家族方法(HC、mHC 及其变体)几乎都停在 $N=4$。作者在 2.5B MoE 模型上扫描 $N\in\{2,4,8,16,32\}$,发现单纯增大 $N$ 迅速饱和:从 $N=4$ 到 $N=16$,损失仅下降 0.006,而训练 FLOPs 却增加 32%,这种收益-成本严重失衡使残差流扩张这条潜在的缩放轴长期未被兑现。论文诊断出两个叠加瓶颈:其一是信息瓶颈,mHC 每层只把单一写回分量 $\Delta x_{l,i}=h^{post}_{l,i}\cdot out$ 注入所有流,当 $N$ 增大时新增流只能复用同一个 out 分量,无法形成非冗余历史,于是变得多余;其二是成本瓶颈,生成 $H^{res}\in\mathbb{R}^{N\times N}$ 需从 $NC$ 维状态预测 $N^2$ 个系数,输入相关投影的开销为 $O(N^3 C)$,扩张代价随 $N$ 增长远快于收益。两个瓶颈叠加导致投资回报率崩溃。
本文的目标是本文的目标是让扩张率 $N$ 成为一条真正可用、可缩放的轴线——即在 mHC 稳定多流公式的基础上,首次实现超出 $N=4$ 的有意义扩张,并且让收益与成本同时受控。具体而言,作者希望在 $N=16$、$k=4$ 的设置下,既通过更丰富的写回信息让新增流变得有用,又通过稀疏化的残差混合把主导开销从 $O(N^3C)$ 压到 $O(k^3C)$;并在 18B、28B MoE 模型上验证 xHC 在可比 FLOPs 预算下显著优于 mHC 与 vanilla 基线,再用缩放定律证明其在跨尺度计算效率上的系统性提升,最后用 xHC-Flash 把内存流量降到接近 mHC($N=4$) 的水平,使大 $N$ 训练在工程上真正可行。
与已有工作不同的是,本文的独特切入角度在于把收益与成本两个瓶颈解耦、再协同治理,而不是像以往 HC 变体那样只在 $N=4$ 做局部优化。针对信息瓶颈,xHC 首次把'写回基'从单一层输出扩展为多尺度因果卷积分量(核 $\{4,8,12\}$),借用相邻 token 的低成本上下文为每条流提供不同的写回成分;针对成本瓶颈,xHC 首创'稀疏写、稠密读'的不对称架构——只更新 $k=4$ 条活跃流却保持对全部 $N=16$ 条流的稠密读取,从而既压低残差映射生成成本,又不切断跨层信息流。这种'两个设计各管一个瓶颈、又随 $N$ 增大相互增益'的结构性协同,是此前 HC 家族方法所没有的视角,也正是 xHC 能让大 $N$ 既有效又可负担的关键。
核心方法
xHC 的整体思路是:先保留 mHC 已被证明可稳定训练的多流残差公式,再把扩张率推到 $N=16$,并用两个互补设计同时松开收益与成本两道枷锁。直觉上,残差流扩张像给模型开辟更多'记忆抽屉',抽屉越多越需要往每个抽屉塞不同内容(信息瓶颈),同时频繁整理全部抽屉代价巨大(成本瓶颈)。为此 xHC 一方面在 MLP 输出后做多尺度因果深度卷积,把单一写回向量 out 扩成 $K_r=4$ 个正交化分量;另一方面引入流路由器用 sigmoid 评分选出 $k=4$ 条活跃流(含 2 条固定流 + 2 条 TopK 路由流),残差混合与后映射只在活跃子集上计算。技术路线上,每层前向分为四步:路由、稠密读、子层变换、稀疏写回,并保证非活跃流原样向后传递以备后续稠密读。这使得 $N=16$ 时 FLOPs 仅比 vanilla 高约 3.0%–4.1%,却换得显著质量提升。
核心创新是'稀疏写、稠密读'的不对称残差架构,叠加时间特征增强。与 mHC 在全部 $N$ 条流上稠密混合($O(N^3C)$)不同,xHC 把残差映射 $H^{res}=SK(f_{res}(X_{active}))\in\mathbb{R}^{k\times k}$ 与后映射 $H^{post}\in\mathbb{R}^{k\times K_r}$ 限制在活跃流上,把成本从 $O(N^3C)$ 压到 $O(k^3C)$;同时保留稠密预映射读 $\mathrm{input}_l=\sum_i h^{pre}_{l,i}x_{l,i}$,让每层仍能访问全部 $N$ 流状态,避免更新的流在下一层未被读取而断流。后映射 $\mathbb{R}^{k\times K_r}$ 让每条活跃流独立组合 $K_r=4$ 个写回分量,配合固定流稳定写回。这种'更新少、读取全'的设计是首次让大 $N$ 既有效又廉价的关键。时间增强则用因果卷积把写回基从 1 维扩到 $K_r$ 维并正交化去冗余,单独使用即把 mHC($N=16$) 验证损失从 1.998 降到 1.984。
方法步骤详情
单个 xHC 子层前向分四步。其一,流路由:对 LayerNorm 归一化扁平状态算 sigmoid 分数 $s=\sigma(\tilde{x}_l W_r)$,按固定+路由方案选 $k$ 条活跃流(2 条固定权重 1、2 条 TopK 权重为 sigmoid 分数),Gather 出 $X_{active}$。其二,映射生成:从活跃状态经 RMSNorm 生成 $H^{res}\in\mathbb{R}^{k\times k}$(4×4 Sinkhorn)与 $H^{post}\in\mathbb{R}^{k\times K_r}$。其三,稠密读与变换:全状态 $H^{pre}$ 加权求和得输入喂 Attn/MLP;MLP 输出做时间增强——三支核 $\{4,8,12\}$ 因果卷积再 Gram-Schmidt 得 $\mathrm{out}_{aug}$。其四,稀疏写回:$X^{new}_{active}=H^{res}X_{active}+p\odot(H^{post}\,\mathrm{out}_{aug})$,Scatter 回全状态,非活跃流原样传递。
技术新颖性
技术新颖性体现在三方面。其一,xHC 是首个在 HC 家族中实现超出 $N=4$ 有意义扩张的方法,把残差流扩张从'小 $N$ 改进'提升为'真正缩放轴'。其二,'稀疏写、稠密读'的不对称架构是一个全新维度上的稀疏化:MoE 在计算上稀疏、稀疏注意力在 token 上稀疏,而 xHC 在残差流维度上稀疏,只激活 $N$ 中 $k$ 条流做混合与写回,却保持读取稠密,这一设计在消融中被证明不可或缺(去掉稠密读+固定流损失恶化到 1.997)。其三,时间特征增强把写回基从 1 维扩到 $K_r=4$ 维并用 Gram-Schmidt 去冗余,精准对应信息瓶颈,且消融显示增益随 $N$ 增大而增大,验证了瓶颈诊断。两个设计结构解耦却高度协同:$N$ 越大,时间增强越有用、稀疏更新越值钱。此外 xHC-Flash 通过共享路由、联合预映射、删除 Attention 侧 $H^{res}$ 实现稠密读复用,把内存流量从 73.5C 压到 40C,工程上也属原创。
实验结果
核心发现分四块。其一,下游评测(Table 1,可比 FLOPs)18B MoE vanilla/mHC/xHC 平均分 40.6/44.8/48.8,xHC 较 mHC +4.0、较 vanilla +8.2;28B 平均 47.8/50.5/53.6。其二,缩放定律(Figure 4,$L=AC^{-\alpha}+E$):达相同损失时 vanilla 需 1.50×、mHC 需 1.19× 的 xHC 计算。其三,扩张率扫描(2.5B,Figure 1):$N$ 从 4 到 16,mHC 仅降 0.006 却多 32% FLOPs,xHC 降 0.012 仅多 4% FLOPs。其四,消融(Table 2,10B):mHC($N=16$) 加时间增强把损失从 1.998 降到 1.984,再加稀疏架构保持 1.983 同时把 FLOPs 开销从 20.1% 砍到 3.3%;k=4 最平衡、sigmoid 优于 softmax。另在 Muon 下 18B 平均 43.1→49.9;xHC-Flash 把内存流量从 73.5C 降到 4sub 的 40C,损失近无损。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 18B MoE 下游平均分 | 12 基准平均 (%) | xHC 48.8 | mHC 44.8 / vanilla 40.6 | 较 mHC +4.0,较 vanilla +8.2 |
| 28B MoE 下游平均分 | 12 基准平均 (%) | xHC 53.6 | mHC 50.5 / vanilla 47.8 | 较 mHC +3.1,FLOPs 仅多 3.0% |
| 训练损失(18B) | final training loss | xHC 1.758 | mHC 1.776 / vanilla 1.799 | xHC 损失最低 |
| 缩放定律等损失计算 | 达成相同损失所需计算倍数 | xHC 1.0× | vanilla 1.50× / mHC 1.19× | xHC 计算效率最优 |
| N 扫描损失下降 (2.5B) | N: 4→16 的损失下降 | xHC 降 0.012(+4% FLOPs) | mHC 降 0.006(+32% FLOPs) | 收益翻倍、成本大降 |
| Muon 优化器 18B | 下游平均 (%) | Muon+xHC 49.9 | Muon 43.1 | +6.8,证明跨优化器有效 |
| 验证损失(10B 消融) | val loss ↓ | xHC 1.983(+3.3% FLOPs) | mHC(N=16) 1.998(+18.8%) | 质量持平、FLOPs 大降 |
| 内存流量(10B) | per-sublayer I/O | xHC-Flash-4sub 40C | xHC 73.5C / mHC(N=4) 34C | 接近 mHC N=4,损失 1.984 |
局限与改进
作者自身承认的主要局限集中在工程效率:xHC 的 FLOPs 开销虽小(18B 多 4.1%、28B 多 3.0%),但维护 16 条残差流使内存流量上升,未优化时每子层 73.5C 约为 mHC($N=4$) 的 2.2 倍,主因是每子层要做两次全状态读(映射生成 + 稠密读聚合),需靠 xHC-Flash 才压到 40C。其次,时间增强仅在 MLP 后施加,加在 Attention 后会经验性地破坏训练稳定。Muon 适配需移除 Gram-Schmidt 并对 xHC 专属投影仍用 AdamW,说明稳定性在一定程度上依赖优化器。从第三方观察看还有几点:主实验与缩放定律全部只在 MoE 主干上验证,未涉及 dense 模型,结论能否迁移存疑;最关键的下游结论依赖 18B/28B 规模与特定训练配方,但文本未给出完整超参(附录 A 未在正文中),复现门槛极高;消融只在 10B 上做,N=16 之外(如 N=8)下游表现未充分展示;xHC-Flash 的路由以 block 入口状态为准、MLP 路由条件于 pre-Attention 状态,这一近似虽损失小但理论上是信息损失。
独立分析的弱点
独立分析有四个弱点及对应改进方向。其一,仅在 MoE 上验证、缺 dense 模型结果:MoE 的稀疏专家可能掩盖或放大残差流扩张的交互效应,建议补充 dense Transformer 的对照实验以确认结论普适性。其二,$k=4$、固定流 $m=2$ 等超参是经验拍定且全程固定,不同层、不同 token 的最优 $k$ 可能不同,可借鉴 MoE 的动态容量或引入层自适应 $k$、token 级路由概率来进一步改善稀疏-质量折中(消融显示 k=8 能再降损失到 1.982)。其三,xHC-Flash 为省一次全状态读删除了 Attention 侧 $H^{res}$,路由也提前到 block 入口,这种'共享路由'近似在长上下文或深层模型中是否仍无损未被检验,可设计层内分组的细粒度复用以兼顾效率与表达力。其四,推理端虽只比 mHC 多 1.3% prefill 延迟,但绝对仍 12.9%,且未报告 decode 阶段 KV 与残差流叠加的内存压力,建议针对推理(尤其长序列 decode)做专门的算子融合与内存预算分析。
未来方向
作者明确提出的方向包括把 xHC-Flash 与 DualPipe 等流水线通信重叠以进一步降低端到端开销,以及在更大 $N$、更大模型上继续验证扩张轴的有效性。基于本文成果可延伸的方向:第一,沿缩放轴继续外推到 $N=32/64$ 并研究扩张率与宽度/深度的联合缩放定律;第二,把'稀疏写、稠密读'的思想与其它跨层信息流方法(如 DenseNet 式特征复用、内存机制)结合,探索更通用的稀疏残差拓扑;第三,研究自适应 $k$ 与动态扩张率,让模型按层/按 token 自动分配残差记忆预算;第四,把时间特征增强推广到更丰富的写回基(如门控混合、可学习核)并验证对密集模型与不同模态的效果;第五,针对长上下文场景评估大 $N$ 残差流在长程依赖建模上的潜力,因为多流状态天然提供更大的跨层记忆。
复现评估
复现评估偏难。论文给出项目页 github.com/aHapBean/xHC,但正文未说明代码与权重是否完整开源;关键超参(学习率、batch、训练步数、专家配置细节)声明放在附录 A,但提供的文本未含该附录,无法直接复用。算力门槛极高:主实验需训练 18B(激活 1.7B)、28B(激活 2.7B)MoE 模型,缩放定律另需每方法 4 个模型跨 1.7e19–4.0e20 FLOPs,消融也要 10B、2.5B 多个规模,远超一般学术团队预算。工程上,论文详尽描述了映射生成/应用两阶段的融合 Triton 算子(合并 LayerNorm/RMSNorm 校正、TopK 路由、Sinkhorn、稀疏 scatter、三支因果卷积),但这些自定义算子需重写并调优,bfloat16 状态 + float32 归一化/路由的混合精度策略也需小心实现。基准评测涵盖 MMLU/MMLU-Pro/BBH/GSM8K/HumanEval/CMMLU 等 12 个基准但 shot 设置同样在附录,均构成额外复现成本。整体属'方法清晰、复现困难'的工业级工作。
论文图表
横轴训练 FLOPs、纵轴语言建模损失,比较 mHC 与 xHC 在 N=2/4/8/16 下的曲线。mHC 在 N=4 后迅速饱和,N:4→16 仅降 0.006 却多 32% FLOPs;xHC 从 N=2 到 N=16 持续下降,N:4→16 降 0.012 仅多 4% FLOPs。
这张图是全文的'楔子',用收益-成本曲线直观证明 mHC 大 N 饱和、xHC 把扩张轴变得有效,是 motivation 与结论的双重支柱。