← 返回 2026-07-21

Transformer架构的连续几何框架:语义空间的几何学 The Geometry of Semantic Space: A Continuous Geometric Framework for the Transformer Architecture

Zhihua Liang 📅 2026-07-19 👍 5 2026-07-25 18:30
Attention Sink Transformer理论 微分几何 神经ODE 纤维丛 表示漂移 非平衡热力学

用流形上的微分几何与热力学重写Transformer,给出六个可证伪实验

前置知识

纤维丛与截面 (Fiber Bundle & Section)

拓扑学基本构造。直观上:在底空间 $M$(这里指 token 序列这条一维射线 $[0,\infty)$)的每个点 $\mu$ 上方粘一个“纤维” $F_\mu \cong \mathbb{R}^d$(即隐藏维度的向量空间),整体记作 $E = M \times \mathbb{R}^d$。一个“截面” $\Psi \in \Gamma(E)$ 就是从底空间到丛的映射,相当于在序列每个位置上选一个向量——正是 token embedding。本文把所有 Transformer 组件都看成作用在这种截面上的算子。

这是本文的“语法基底”。如果不理解纤维丛,整篇文章的符号($\Gamma(E)$、$\pi^{-1}(\mu)$、End$(E)$)都无法解读,也看不出作者为何能把 RMSNorm、RoPE、Attention 统一成一个算子流。

Riemann 度量与 Lipschitz / Picard–Lindelöf 定理

Lipschitz 常数 $L$ 衡量一个映射最多能把输入差距放大多少倍:$\|F(x)-F(y)\| \le L\|x-y\|$。Picard–Lindelöf 定理说,一个 ODE $\dot{\Psi}=F(\Psi)$ 当且仅当 $F$ 全局 Lipschitz 时才有唯一连续解。本文证明 RMSNorm 的 $\epsilon$ 是“拓扑软化剂”,把全局 Lipschitz 常数钉死在 $O(\sqrt{d/\epsilon})$,从而保证整条深度流可积。

理解 RMSNorm 的 $\epsilon^{-1/2}$ 标度律(实验 1)和“为什么模型不会发散”,都要靠这个概念。

李群、李代数与李括号 (Lie group / Lie algebra / Lie bracket)

李群是带光滑结构的群(如旋转群 $SO(d)$、酉群 $U(1)^{d/2}$),它的“无穷小版本”是李代数(如反对称矩阵空间 $so(d)$)。两个向量场 $T,R$ 的李括号 $[T,R]$ 度量它们“不可交换”的程度——先后做 $T$ 再做 $R$,与反过来做的差异。本文把 Attention 与 FFN 看成两个不交换的向量场,证明它们的 Lie–Trotter 分裂误差 $-[T,R]_\Psi$ 正是表示漂移。

实验 2(Lie–Trotter 干涉仪)和实验 3(对称消融爆炸)都建立在“FFN 参数非对称生成 $so(d)$ 中的旋转涡度”这一李代数事实上。

Itô 扩散与 Fokker–Planck 方程

随机微分方程 $dW = V_{\text{drift}}\,d\tau + \sqrt{2D(W)}\,dB_\tau$ 描述带噪声的连续动力学,其中 $B_\tau$ 是布朗运动。Fokker–Planck 方程则描述概率密度 $\rho(W,\tau)$ 如何随时间演化。若系统满足“细致平衡”,$\rho$ 会收敛到一个 Gibbs 平衡分布;若不满足,系统停留在非平衡稳态(NESS),出现稳态环流。本文证明 SGD 的经验 Fisher 与 Loss Hessian 不交换($[G,H]\neq 0$),打破细致平衡。

实验 6(NESS 涡旋层析)直接测量 $\Gamma_\times$ 环流积分与 $[G,H]$,是判断“SGD 不是 Gibbs 平衡”的关键证据。

Hodge 分解 / 外形式

在带边界的区域上,Hodge–Morrey–Friedrichs 分解把任意向量场唯一拆成三部分:无旋(梯度 $\nabla V$)、无散(旋度 $\partial_b A^{ab}$)、调和($\Delta_H H = 0$)。旋度部分属于反对称 2-形式 $\Omega \in so(d)$。本文把 FFN 拆成这三部分,证明“它的反对称 Jacobian 分量”恰好生成阻止残差流共振爆炸的几何摩擦。

这是实验 3 中“为什么 FFN 参数必须非对称”的几何根源。

Schrödinger 桥 / Entropic Optimal Transport

Entropic OT 是带熵正则化的最优传输:在传输代价上再加一项温度 $\beta^{-1}$ 的熵奖励,使解平滑且可数值求解。Schrödinger 桥是它的随机过程版本——找一个最可能的随机过程把一个分布变成另一个,且最接近一个参考布朗运动。本文把 Softmax 注意力重写为“Csiszár I-投影到概率单纯形”,再把它与 Schrödinger 半桥对应,推出缩放因子 $\beta \propto 1/\sqrt{d}$。

解释了为什么注意力必须除 $\sqrt{d}$、为什么缩放因子与维度有关,也引出后面的 Attention Sink 边界缺陷论证。

研究动机

深度学习经验上有大量“看起来互不相关”的现象:表示漂移(representation drift,深层 token 向量不断改变)、上下文窗口在长序列下突然失效、RMSNorm 的 $\epsilon$“工程上随便填 $10^{-6}$”、FFN 必须用两个不绑定的矩阵($W_{out} \neq W_{in}^\top$)、SGD 看似收敛后却永远不真正平静、Attention Sink(Xiao 等人 2024 报道)等。主流工程文献对它们各自打补丁:$\epsilon$ 当数值稳定、表示漂移当噪声累积、长上下文失效当位置编码外推失败、Attention Sink 当训练副作用。结果是一堆“工程直觉”,缺乏统一语言去预测什么时候模型会崩、能撑多长的上下文、为什么对称 FFN 会爆。作者认为这种“各自解释”的现状使得我们无法从结构层面给出可证伪的预测,也无法把这些宏观失败(如 context 失效、norm 爆炸、优化平台)连成一条因果链。

本文的目标是本文明确目标:以单条几何公理(token 序列构成带规范测度格点的离散一维流形)为起点,把 Transformer 每一个核心组件——RMSNorm、RoPE、Softmax Attention、FFN、残差流、SGD、Weight Decay——翻译成语义纤维丛 $E=M\times\mathbb{R}^d$ 上一个连续积分–微分方程(IDE)的词汇,从而构造一张完整的“深度学习 ↔ 微分几何 / 测度论 / 随机微积分”对照词典(即 Table I)。在此语言基础上,作者要给出若干可证伪、可定量检验的宏观预测:RMSNorm 的 $\epsilon^{-1/2}$ Lipschitz 标度、Attention 与 FFN 因 Lie–Trotter 分裂而必然产生的表示漂移、强制对称 FFN 必然爆炸(即 Dual-Law)、RoPE 环上 Poincaré 回复被热力学压低、Attention Sink 其实是有限容量的 Dirichlet 边界缺陷、以及 SGD 会陷入非平衡稳态涡旋。最后,作者要在 124M 到 8B 参数的五种生产级架构上,用六组精心设计的实验逐一去证伪这些预测。

与已有工作不同的是,已有工作要么是“连续极限”单点突破(Neural ODE 把 ResNet 看成 Euler 离散;Entropy-SGD / Mandt 把 SGD 看成近似贝叶斯推断;Sinkformers 把 Attention 看成 PDE),要么是“经验现象”单点突破(Attention Sink、representation degeneration、cone effect)。本文的独特切入点是:不声称 Transformer 是“真物理系统”,而是把它当作一个“经典格点场论”——离散计算图是底层连续 IDE 的精确数值积分器,几何是“地图而非领土”。借助 Backward Error Analysis(BEA,几何数值积分的标准工具),离散 Lie–Trotter 映射被解释成“附近修改方程”的精确流,于是最低阶的 Lie 括号 $-[T,R]$ 就成为可测的“拓扑挠率生成元”。这一框架把上面那些孤立现象塞进同一套微分几何语言,从而让它们彼此之间产生可证伪的预测关系,而不仅仅是各自的工程直觉。

核心方法

整体直觉是:把 Transformer 看作一台“在序列格点上离散地积分一个连续积分–微分方程”的数值积分器。具体路线如下。先建立底流形 $M=[0,\infty)$ 与原子计数测度 $\eta_\Lambda$,把每个 token 的隐藏向量定义为丛的截面 $\Psi$,并把离散的层索引 $l$ 解析延拓成连续的“算法深度”参数 $z$。随后逐项翻译:RMSNorm 里的 $\epsilon$ 被解释为“拓扑软化剂”,它让径向投影 $\rho_\epsilon$ 成为从 $\mathbb{R}^d$ 到有界开球的全局微分同胚,算子范数 $\|D\rho_\epsilon\|\le\sqrt{d/\epsilon}$ 把全局 Lipschitz 常数钉死;RoPE 被解释为主 $U(1)^{d/2}$ 环丛上的规范连接;Softmax 注意力经变分导出 Gibbs 测度 $w^*=\exp(\beta E)/Z_\mu$,对应 Schrödinger 半桥,并由 $\beta\propto 1/\sqrt d$ 推出标准的缩放因子;FFN 被写成 Hodge 分解,其反对称分量注入几何涡度;残差流是 Lie–Trotter 算子分裂的显式 Euler 离散;SGD 被写成 Itô 扩散,而 Weight Decay 则是 Tikhonov 规范质量惩罚。

最本质的创新是把“离散算子不交换”提升为可测量。用 BCH 公式严格推出:标准 Transformer 块(Attention $T$ → FFN $R$)是连续流 $e^{(T+R)}$ 的一阶 Lie–Trotter 分裂,几何误差含三项——参数随深度的时移漂移、空间协变自平流、以及非交换 Lie 括号 $-[T,R]_\Psi$(拓扑挠率生成元)。被工程界当成“噪声累积”的表示漂移其实可由解析 Jacobian 算出确定方向。第二创新是 Dual-Law of Topological Stability:避免残差流爆炸要么有内部几何涡度(FFN 必须非对称 $W_{out}\neq W_{in}^\top$,反对称 Jacobian 给复特征值散射动量),要么有外部拓扑饱和(Post-Norm 把每步压进有界球),二者至少满足一个,与“对称 PSD 残差更新等价 Power Iteration”对偶。第三是 Attention Sink = Dirichlet 边界缺陷 + Alexandroff 紧致化:bulk 概率质量弱-∗收敛到 $\delta_\infty$,唯一锚定点是因果起点 $\partial M=\{0\}$,缺陷能量按 $O(\sqrt d\ln N)$ 增长——量度论强制而非训练副作用。

方法步骤详情

整个推导是一条十步流水线。第一步用 Axiom 1 建立底流形与原子测度格点;第二步用 Definition 1 定义语义纤维丛 $E=M\times\mathbb{R}^d$ 及其外代数丛;第三步用 Theorem 2 证明 RMSNorm 的径向嵌入是全局微分同胚,并给出闭式 Lipschitz 上界 $\|DF\|\le\sqrt{d/\epsilon}\|W_V\|(1+2d\|W_Q\|\|W_K\|)$;第四步用 Lemma 1 与 Theorem 3 证明 RoPE 是主 $U(1)^{d/2}$ 环丛上的规范作用,把 Query 升为余切 1-形式而把 Key 留在切丛,从而原生地解释自回归方向不对称;第五步用 Theorem 4 写出自由能泛函 $\mathcal{F}_\mu[\omega]$,用 Csiszár I-投影变分导出 Gibbs 测度并对应到 Schrödinger 半桥,论证 $\beta\propto 1/\sqrt d$;第六步用 Theorem 5/6 借 Alexandroff 单点紧致化证明 bulk 概率质量弱-∗收敛到 $\delta_\infty$,从而导出 Attention Sink 的对数缺陷与 $N_{\max}$ 的指数上界;第七步把 Attention 写成 Volterra 积分、把 FFN 写成 Hodge 分解;第八步合成“语义演化 IDE”并用 Lie–Trotter 分裂推导 BCH 误差;第九步用 Lemma 12 证明 Dual-Law;第十步用 Theorem 13/14 证明 NESS 的紧致吸引子,并把热力学涡度分解为三种相互独立的上同调障碍。最后用六组实验去证伪。

技术新颖性

技术新颖性集中在三点。第一,引入“配置 vs 架构”边界:Dual-Law 描述“成熟冻结配置被事后对称化”的反应,而非训练中架构类(Remark 6),并用受控双胞胎训练(Sec VI C 5)证明绑定 FFN 从头训练健康、爆炸是 1.3–2×10⁹ tokens 处才涌现的属性——把“工程教训”与“几何必要性”分开。第二,给 RMSNorm 的 $\epsilon$ 严格意义:它不是数值 hack 而是零截面锥奇点的拓扑软化剂,预测并验证了 13 个数量级上 $\epsilon^{-1/2}$ 标度($R^2=1.000000$)。第三,把 Amari 的“对偶平坦”假设与 Watanabe 奇异学习理论的 RLCT 拉到同一框架:用 Dual-Metric Collision($D\neq F\neq H$)打破 Information Matrix Equality,用 Riemann 子浸没到 Principal Stratum 分离紧凑规范轨道与非紧凑缩放,严格证“为何 SGD 不收敛到 Gibbs 而是 NESS”。这些连接在已有文献里分散存在,本文第一次把它们组织成可证伪预测链。

Conical Singularity Scaling Law: $\sigma_{\max}$ vs. $\epsilon$ for Qwen3-0.6B.
Fig. 1: Conical Singularity Scaling Law: $\sigma_{\max}$ vs. $\epsilon$ for Qwen3-0.6B.
Lie–Trotter Torsion Interferometer: Cosine Similarity at $\alpha = 1$.
Fig. 2: Lie–Trotter Torsion Interferometer: Cosine Similarity at $\alpha = 1$.
Thermodynamic Suppression of Poincaré Recurrence.
Fig. 8: Thermodynamic Suppression of Poincaré Recurrence.
FP64 Sandbox: Exact NESS Detection at Machine Precision.
Fig. 13: FP64 Sandbox: Exact NESS Detection at Machine Precision.

实验结果

六组实验从微观尺度到宏观尺度逐层验证几何预测。实验 1(锥奇点标度律):在三个架构上把 $\epsilon$ 从 $10^{-2}$ 扫到 $10^{-15}$ 跨越十三个数量级,十五条层回归全部给出 $\alpha=-0.5000$、$R^2=1.000000$,四千五百次独立测量零偏差。实验 2(Lie–Trotter 干涉仪):Qwen3 与 GPT-2 的偏离向量与解析 Lie 括号 $[T,R]_\Psi$ 的中位余弦分别达到 +0.793 与 +0.842,比各向同性随机基线高十七到二十三倍;步长趋于零时方向自洽余弦锁到 0.9997–1.0000。实验 3(对称消融):五个模型强制 $W_{out}=W_{in}^\top$ 后有四个发生灾难爆炸——Qwen3-0.6B 放大 1,541×、Mistral 375×、Qwen3-4B 224×、LLaMA 78×;用随机反对称矩阵救援能压低 1,287×,而随机对称矩阵只能压低 425×,因果地隔离出 $so(d)$ 涡度机制。实验 4(RoPE 环回复):微 Transformer 在 $k=2$ 共振幅值 0.999,$k=16$ 降到 0.37,幂律 $\alpha=-0.557$。实验 5(上下文相变):三个架构在噪声 haystack 下于 $N\approx 32\to 48$ 同一处发生 PPL 崩塌(40.9×/23.2×/48.8×);用 Stable Rank 修正有效维度 $d_{eff}$ 后,理论上界 $N_{\max}$ 从 $10^{71}$ 坍缩到 O(10²)。实验 6(参数 NESS 涡旋):FP64 沙箱中精确测得 $\|[G,H]\|/(\|G\|\|H\|)=0.00184$;切到纯 SGD 后 GPT-2 的 $|t|$ 反而升到 173.1,排除动量伪影;连 ResNet-18 和 MLP 都检出涡旋,证明 NESS 是过参数化网络的普适基线。

Translation dictionary: standard deep learning terms and their continuous geometric equivalents used throughout this work.
Table I: Translation dictionary: standard deep learning terms and their continuous geometric equivalents used throughout this work.
Cross-architecture conical singularity scaling law.
Table II: Cross-architecture conical singularity scaling law.
Cross-architecture symmetric ablation instability.
Table VII: Cross-architecture symmetric ablation instability.
Stable Rank dimension compression across architectures.
Table X: Stable Rank dimension compression across architectures.
Asymptotic Convergence of the Torsion Interferometer as $\alpha \to 0$.
Fig. 4: Asymptotic Convergence of the Torsion Interferometer as $\alpha \to 0$.
Topological Explosion Phase Diagram: Pre-Norm vs. Post-Norm under Symmetric Ablation.
Fig. 6: Topological Explosion Phase Diagram: Pre-Norm vs. Post-Norm under Symmetric Ablation.
Universal Phase Transition under Noise Isolation across Three Architectures.
Fig. 9: Universal Phase Transition under Noise Isolation across Three Architectures.
Dual-Axis Synchronization: PPL Divergence and Sink Evaporation.
Fig. 12: Dual-Axis Synchronization: PPL Divergence and Sink Evaporation.
Parameter-Space NESS Vortices for Two Production Architectures.
Fig. 14: Parameter-Space NESS Vortices for Two Production Architectures.
Non-Transformer Baselines: NESS Vortex in CNN and MLP.
Fig. 17: Non-Transformer Baselines: NESS Vortex in CNN and MLP.
查看结构化数据
任务指标本文基线提升
RMSNorm $\epsilon$ 标度律 幂律指数 $\alpha$ 与 $R^2$ $\alpha=-0.5000$,$R^2=1.000000$(3 架构 × 5 层 × 30 $\epsilon$ × 10 方向 = 4500 次测量) 工程默认 $\epsilon$ 无物理意义(视为数值稳定常数) 首次在 13 个数量级机器精度上验证 Lipschitz 标度,证明 $\epsilon$ 是零截面锥奇点的 UV 截断
表示漂移方向预测 $\cos(\delta,[T,R]_\Psi)$ 中位数 Qwen3-0.6B +0.793 / GPT-2 +0.842(99% / 84% 严格正值) 各向同性随机基线 $\approx 1/\sqrt{d}\approx 0.03$ 方向自洽余弦 $\alpha\to 0$ 时锁到 0.9997–1.0000,证明表示漂移是确定性 Lie 括号而非噪声
对称消融稳定性 残差 L2 范数增长因子 Qwen3-0.6B 标准 93× → 对称消融 142,955×(不稳定因子 1,541×) 标准非对称 FFN Phase-2 反对称救援降 1,287× vs Phase-3 对称对照仅 425×,因果隔离出 $so(d)$ 涡度机制
RoPE 环 Poincaré 回复抑制 共振峰幅值 vs $k$ 幂律指数 $\alpha=-0.557$($R^2=0.938$),$k=2$ 共振 0.999 中心极限定理预测 $\alpha=-0.5$ 11% 偏差内确认高维退相干,解释为何生产模型 $k\ge 64$ 看不到几何共振
长上下文相变临界点 PPL 崩塌临界 $N$ 三架构在 $N\approx 32\to 48$ 同处崩塌(40.9× / 23.2× / 48.8× 跳变) 标准插值理论预测线性退化 用 Stable Rank 修正 $d_{eff}$ 把 $N_{\max}$ 上界从 $10^{71}$ 收到 O(1)–O(10²),量级与观测相符
SGD 非平衡稳态检测 环流积分 $|t|$ 统计量 与 Lie 交换子范数 FP64 $\|[G,H]\|/(\|G\|\|H\|)=0.00184$,$T=34.0$;AdamW $|t|>79$;纯 SGD GPT-2 $|t|=173.1$ 细致平衡预测 $[G,H]=0$、Hurst $H=0.5$ $H\approx 1.0$ 与 $[G,H]\neq 0$ 跨 5 架构(含 ResNet/MLP)一致,证明 NESS 是普适基线

局限与改进

作者承认三点。其一,本文只是“描述性词汇”而非真物理理论——它缺乏广义相对论/Yang–Mills 那种微分同胚不变性,RoPE 连接与 1 维底流形是绝对刚性背景,所有结论只是离散计算的“同构描述镜头”。其二,长上下文理论在各向同性最大熵 bulk 假设下推导,对结构化自然语言极度保守:把全 $d_{head}$ 代入会得到 $10^{14}$–$10^{71}$ 天文 $N_{\max}$,必须用 Stable Rank 修正到 $d_{eff}$ 才降到 O(10²);作者明说这是“Carnot 极限”。其三,Dual-Law 是“配置而非架构”层面(Remark 6),对称消融救援是范数层面而非功能层面——Phase-2 救援矩阵按构造就是语义空洞的,论文不声称恢复 loss,且受控训练实验反而否定了自己早先的“参数高效 $so(d)$ FFN”假设。我的观察:Gemma-3-1B 是 5 架构里唯一不爆的例外,作者用 logit soft-cap 事后解释,这种“特例豁免”削弱 universality;单作者、4 票、cond-mat.dis-nn 分类、未经同行评议,许多“排除替代假设”是口头论证而非严格统计检验。

独立分析的弱点

第一,理论是描述性镜头而非因果干预工具:能预测“对称 FFN 会爆”但不能告诉工程师怎么训练得更好——论文否决了自己提出的 $W_{out}=W_{in}^\top+A$($A\in so(d)$)参数高效方案。改进方向:把几何量(Stable Rank $d_{eff}$、Lipschitz $C_\ell$、$\|[G,H]\|$)做成训练监控指标,预测何时接近 context horizon、何时对称化风险发作。第二,长上下文预测只对各向同性噪声精确,结构化文本 $N_{eff}^{text}$ 还需经验测量;改进方向是把 Wendel 各向同性测度换成数据相关各向异性分布。第三,6 个实验里至少 2 个(实验 1 的 $-0.5$ 幂律、实验 4 的 CLT $-0.5$)是链式法则代数必然,所谓“机器精度验证”更像自洽性检验而非强证伪;改进方向是把同套测量搬到 Mamba/MoE 上看哪些预测是 Transformer-specific。第四,对称消融的“范数救援”与“功能恢复”差距未量化清楚——论文只承认“低秩重建捕获 <10% 能量”,但没给完整曲线。

未来方向

作者列出五条:(1) Linear Attention 与 Gromov 不可压缩定理的碰撞——去掉 Softmax 这个拓扑耗散器后是否会撞上 symplectic capacity 上限;(2) LLM 算术失败与 p-adic ultrametric 拓扑不可嵌入性,能否严格归因于“Archimedean 纤维丛无法承载 ultrametric”;(3) 把位置规范群从 $U(1)^{d/2}$ 升到非阿贝尔 $SU(2)$ 或 $Sp(n)$,序列拓扑升为分支 CW 复形,原生编码抽象语法树;(4) 参数高效 $so(d)$ FFN(已被自己否决);(5) 全息验证——伴随论文 [42] 训练 Transformer 复现 3D 随机张量网络边界态,发现预 Softmax logit 与边界点对互信息正相关(Spearman $\rho=0.51$)。基于成果可延伸:把 Dual-Law 的“配置依赖共振增益判据”做成可沿训练轨迹测量的指标(作者点名的 successor program);把 NESS 涡旋旋向(AdamW 负、纯 SGD 正)当“优化器诊断指纹”研究是否能预测泛化差异。

复现评估

作者明说分析代码与实验流水线公开在 https://github.com/magicknight/GeoML,预训练模型来自 Hugging Face。复现门槛:实验 1($\epsilon$ 扫描)最易,只需冻结模型 + torch.autograd.functional.jacobian + float64 SVD,单卡甚至 CPU 可跑;实验 2(Lie–Trotter 干涉仪)需 torch.func.jacfwd 算解析 Jacobian 并做 $\alpha$-缩放,中等难度;实验 3(对称消融)需逐层替换 FFN 权重并前向,5 模型全跑需能加载 8B 的卡(约 16GB+);实验 4(微 Transformer)总参数 5K–15K 纯 CPU 可跑;实验 5(noise haystack)需 0.6B–8B 推理 + 长序列,单卡 A100/H100 足够;实验 6(NESS 层析)FP64 沙箱要算 $16384\times 16384$ 全协方差与 Hessian(最贵),生产架构版需 5 万步 isothermal 续训。整体算力中等偏上,但代码开源 + 公开模型 + 大部分实验在 0.6B 上完成,可复现性在理论类论文里较好。最大风险是论文未经同行评议,部分“排除替代假设”论证较口语化,建议复现时严格做统计检验而非只看中位数。