← 返回 2026-07-22

潜意识时钟:扩散语言模型中的隐式时间建模 Subliminal Clocks: Latent Time Modelling in Diffusion Language Models

Maximo Eduardo Rulli, Thomas Vaitses Fontanari, Simone Petruzzi, Federico Alvetreti, Giorgio Strano, Donato Crisostomi, Giorgos Nikolaou, Tommaso Mencattini, Andrea Santilli, Emanuele Rodolà, Simone Scardapane, Alessio Devoto 📅 2026-07-20 👍 38 2026-07-27 18:30
扩散语言模型 机制可解释性 潜在引导 激活探针 表示几何

扩散语言模型内部潜藏去噪进度信号,可被探针读取与因果引导

前置知识

扩散语言模型(Diffusion Language Model, DLM)

区别于自回归逐 token 左到右生成,DLM 以类 BERT 的方式,从一段全 [MASK] 的回答窗口出发,在 T 个去噪步内逐步把掩码位「揭示」为真实 token。训练时模型接收一个按概率 $s$ 随机打掩码的序列 $x_s$,只在被掩码位置 $\mathcal{M}(x_s)$ 上用重加权交叉熵 $\frac{1}{s}\log p_\theta(x_j^0|x_s)$ 学习预测原始 token。代表性大规模模型有 LLaDA、Dream、MDLM。关键点:与图像扩散不同,这类模型推理时并不把时间步 $t$ 显式喂给网络。

本文全部问题都建立在「DLM 没有显式时间步输入」这一前提上,必须先理解 DLM 的掩码去噪范式才能理解作者在追问什么。

吸收态掩码扩散(Absorbing-State Masked Diffusion)

离散扩散的一种特化形式:噪声过程只把 token 替换成单个特殊的 [MASK]「吸收态」,每个位置独立以概率 $s$ 被掩码。理论上有两个关键性质——反向过程只需去噪掩码位,且得分可写成「干净数据条件分布乘上一个解析的、时间相关的因子」。这使得剩余掩码比例 $1-\tau_t=|\mathcal{M}(x_t)|/L$ 成为去噪进度的天然可观测量。

正是因为理论上掩码比例 $\approx$ 去噪时间,作者才能用经验量 $\tau_t=1-|\mathcal{M}(x_t)|/L$ 作为探针的目标标签,把它当作模型内部「时钟」的可观测代理。

激活探针(Activation Probing)

用一个小的监督模型(本文是带 sigmoid 头的 5 层残差 MLP)以模型某层的某个隐藏状态 $h_{j,l}^{t,n}$ 为输入,去回归一个目标变量(这里是去噪进度 $\tau$)。若探针的 $R^2$ 高,说明该隐藏状态里线性或浅层可读地编码了这个目标。线性探针和 MLP 探针的差距还能揭示信息的「非线性可读性」。

探针是本文回答 RQ1(模型是否内部表示了去噪进度)的核心工具,读懂本文必须理解 $R^2$、Pearson/Spearman 相关以及「单 token 状态回归出序列级统计量」意味着什么。

均值激活向量与表示引导(Mean Activation Vectors & Steering)

把大量样本在「同一去噪步 $t$、同一层 $l$」上的隐藏状态取平均得到 $\mu_{t,l}=\mathbb{E}_{n,j}[h_{j,l}^{t,n}]$,能压掉样本特异噪声、保留系统性信号。引导(steering)即在推理时把当前隐状态朝目标步的均值偏移:$\tilde{h}=h-\mu_{t,l}+\mu_{\hat{t},l}$,由于差值会消去共享层偏移 $\bar{\mu}_l$,从而隔离出 $\tau$ 专属方向。

这是本文回答 RQ2(信号是否因果重要)的核心干预手段,也是验证「均值向量方向 = 模型内部时钟」的关键实验设计,理解差分抵消机制是看懂引导实验的前提。

残差流与表示几何(Residual Stream & Representation Geometry)

残差流是 Transformer 中贯穿各层的主干通道,注意力与 MLP 都从中读写。表示几何用 PCA、余弦相似度等工具刻画激活向量在高维空间中的低维流形形状。本文发现 $\tau$ 的均值向量落在仅 1-3 个主成分就解释 >90% 方差的子空间里,且呈抛物线状。

回答 RQ3(信号有何结构、是否有统一的模型级表示)完全依赖这套几何分析,抛物线、跨层对齐、层内组件余弦相似度等结论都建立在对残差流几何的理解上。

研究动机

扩散语言模型近期被视为自回归模型的有力替代,但与图像扩散有一个根本差异:标准扩散会把时间步 $t$ 显式喂给网络,而以 LLaDA、Dream 为代表的掩码型 DLM 推理时并不接收任何时间步输入。于是自然产生一个被忽视的问题——这些模型到底有没有在内部表示「我现在去噪到第几步了」?现有 DLM 研究绝大多数聚焦效率与生成质量(Fast-DLLM、Block Diffusion、R2-DLLM),少量可解释性工作分别研究了 LLaDA/Dream 上的稀疏自编码器概念引导、注意力下沉随去噪步移动、用操纵 [MASK] 诱导有害生成、以及掩码数量对性能的强烈影响,却都没正面刻画「去噪过程本身的内部动力学」。理论上,吸收态扩散的强表现被归因于 [MASK] 的特殊地位,且掩码扩散目标可改写为关于掩码数量的形式,使连续去噪时间接近掩码比例的松弛。于是「剩余掩码比例」成为去噪进度的天然可观测量,但它是否、如何被模型内部表征依然完全悬而未决——不搞清这一点,就无法解释 DLM 为何有效、无法安全干预、也无法设计更好的解码策略。

本文的目标是本文设定三个层层递进、且尽量可量化的研究问题。RQ1:DLM 内部是否真的编码了一个与去噪步相关的信号?可量化判据是——能否训练探针从残差流以高 $R^2$(例如跨所有层 $R^2>0.5$)恢复出经验去噪进度 $\tau_t=1-|\mathcal{M}(x_t)|/L$。RQ2:这个信号对生成过程是否因果重要?判据是——沿所识别方向引导后,模型置信度、熵、与干净分布的 KL 散度是否按可预测方式(置信度随 $\hat{t}$ 增大而升、KL 近似正比于 $|\hat{t}-t|$)系统性变化,且效果显著强于等范数随机扰动。RQ3:该信号有何结构特征、是否存在统一的模型级表示?判据是——PCA 下能否呈现低维有序几何、跨层余弦相似度是否揭示共享/分块组织。最终目标是对一个去噪进度信号给出「可探测、可引导、被反复校正、且低维结构化」的完整刻画。

与已有工作不同的是,现有 DLM 可解释性工作各有盲区:稀疏自编码器关注概念引导、注意力下沉关注冗余头、掩码操纵关注安全漏洞、长度感知关注下游性能,唯独没人刻画去噪进度信号本身。更广义的表示几何工作(Gurnee 等的计数任务、Engels、Modell、Karkada 等关于流形几何)研究的都是「人类概念」(年份、月份),其几何源于统计共现;而本文抓的是一类完全不同的信号——一个序列级的「元统计量」(未掩码比例),模型为了追踪自身去噪进度而主动重建它。本文的独特切入是:把探针(读信号)、均值向量引导(因果验证信号)、几何分析(刻画信号结构)三件套整合到对单一信号、两个模型(LLaDA、Dream)的统一刻画上,并特别强调引导用的是均值向量差分——它会抵消层共享偏置、把 $\tau$ 专属方向干净地隔离出来。

核心方法

直觉上,可以把 DLM 想象成一位按 100 步工序做菜的厨师:没人告诉它「你现在到第 17 步」,但它也许在脑子里(残差流里)默默拨着一只内嵌的秒表。本文就问三件事——能不能读出这只秒表?能不能把它往前/往后拨、并观察菜品随之变化?这只秒表的表盘长什么样?技术路线分三阶段。第一阶段「探针」:为每一层训练一个小 MLP,输入单个 token 的隐藏状态去回归当前去噪进度 $\tau$,若 $R^2$ 高就说明秒表可读。第二阶段「引导」:对每个 $(t,l)$ 把大量样本的隐状态平均得到均值向量 $\mu_{t,l}$,推理时把当前隐状态替换成 $\tilde{h}=h-\mu_{t,l}+\mu_{\hat{t},l}$,再测熵/置信度/KL 的变化。第三阶段「几何」:对均值向量做 PCA 揭示低维抛物线,用跨层余弦相似度判断 LLaDA 全局共享还是 Dream 分块组织,用层内组件余弦相似度揭示注意力与 MLP 是否反向。整个方法锚定在 $\tau_t=1-|\mathcal{M}(x_t)|/L$ 这个经验量上(附录 A 证明它期望意义下等于训练噪声水平 $s$ 的补)。

核心创新是发现并因果验证:DLM 即便从未被显式喂入时间步,也在残差流里悄悄编码了一只「潜意识时钟」——一个关于去噪进度 $\tau$(未掩码比例 $\tau_t=1-|\mathcal{M}(x_t)|/L$)的潜在表示。它和已有可解释性工作的本质区别有三。其一,研究对象不同:它不是人类概念(年份/月份那种源于统计共现的几何),而是一个模型为追踪自身进度而重建的序列级「元统计量」。其二,干预设计更干净:引导用的是均值向量差分 $\Delta=\mu_{\hat{t},l}-\mu_{t,l}$,由于公共层偏置 $\bar{\mu}_l$ 在做差时抵消,正好把 $\tau$ 专属方向隔离出来;而等范数随机扰动产生的 KL 只有它的一半左右、且无相干趋势,有力排除了「这只是大扰动都会有的副作用」的解释。其三,结构发现具有因果双重支持:信号不仅可读、可引导,还落在仅 1-3 个主成分就解释 >90% 方差的子空间里、呈抛物线,且用前 2 个主成分做子空间引导就能复现全向量的下游效果——说明这只钟确实住在一个极低维、且跨层(LLaDA 除最后一层外)共享的子空间里。

方法步骤详情

步骤一(探针,RQ1):对每层 $l$ 拟合 MLP 探针 $\phi_l:\mathbb{R}^d\to(0,1)$,最小化 $\mathcal{L}_{\text{MLP}}=\mathbb{E}_{t,n,j}(\tau_t-\phi_l(h_{j,l}^{t,n}))^2$;架构是 5 层残差 MLP(Linear→LayerNorm→GELU,sigmoid 头压到 $(0,1)$,宽度 $\min(d,1024)$),300 训/100 验、20 epoch、AdamW($\eta=10^{-3}$、权重衰减 $6\times10^{-6}$);分别用 [MASK]/非 [MASK]/全部 token 训练。输入单隐状态、输出预测 $\tau$。步骤二(均值向量):把去噪离散为 100 bin,按 $\mu_{t,l}=\mathbb{E}_{n,j}[h_{j,l}^{t,n}]$ 算出 LLaDA 3200 个、Dream 2800 个均值向量,并验证 $\phi_l(\mu_{t,l})$ 与 $t/100$ 高度相关(LLaDA 0.976/0.980,Dream 0.962/0.974)。步骤三(引导,RQ2):推理时按 $\tilde{h}_{j,l}^t=h_{j,l}^t-\mu_{t,l}+\mu_{\hat{t},l}$ 扰动,测 $\Delta\bar{S}_t$、$\Delta\bar{c}_t$、$\text{KL}_t$;对照为等范数随机扰动 $\tilde{h}=h+a_{t\to\hat{t}},\,a\sim\mathcal{N}(0,C_{t,l})$。步骤四(几何,RQ3):均值向量做 PCA 投影 2D/3D;用公式 (7) 把 $\Delta$ 投到前 $k$ 主成分子空间及其正交补(各自重缩放到原范数)做子空间引导;再算同索引均值向量的跨层余弦相似度,以及层内组件(自注意力、门控、升维、输出、RMSNorm)间的余弦相似度。

技术新颖性

新颖性体现在三点。第一,这是首次对「去噪进度信号」本身的刻画:先前 DLM 可解释性要么做 SAE 概念引导(Wang 等 2026)、要么研究注意力下沉(Rulli 等 2025)、掩码操纵攻击(Wen 等 2026)、或下游长度感知(Rossi 等 2026),都没碰进度信号;尤其 Zhou 等 2026 发现概念只在某些去噪步可引导,而本文的 $\tau$ 信号贯穿全程且被反复重算,形成鲜明对照。第二,引导方法用均值向量差分抵消了层共享偏置 $\bar{\mu}_l$,比通用的激活加法更干净地隔离出 $\tau$ 方向,并通过「随机等范数扰动 KL 只有约一半」这一对照排除了机械性解释。第三,几何发现把 DLM 与计数/时间任务的流形几何文献(Gurnee、Engels、Modell、Karkada)联系起来——信号呈低维抛物线、在 LLaDA 跨层共享(唯最后一层近正交)、在 Dream 分成 3 个计算块(层 1-6、7-20、21-27),且自注意力与 MLP 带反向表示,这些结构性洞见此前从未在 DLM 上被报告。

LLaDA 潜在去噪步建模的 3D 投影
Figure 1: LLaDA 潜在去噪步建模的 3D 投影
MLP 探针恢复 $\tau$ 信号(LLaDA 各层 $R^2$)
Figure 2: MLP 探针恢复 $\tau$ 信号(LLaDA 各层 $R^2$)

实验结果

RQ1(探针):MLP 探针在 LLaDA 全部 32 层保持 $R^2>0.5$(中层峰值约 0.94、首尾略降),Dream 同样跨层高位;[MASK] 略优于非 [MASK] 但两者都高度可恢复,说明 $\tau$ 分布在整个残差流而非局部掩码位。每个探针只看单个隐状态就能恢复序列级 $\tau$;$\phi_l(\mu_{t,l})$ 与 $t/100$ 相关性 LLaDA 达 Pearson 0.976/Spearman 0.980、Dream 0.962/0.974。线性探针深层塌缩到均值基线而 MLP 存活,说明深层信息是非线性编码而非消失。RQ2(引导):在 LLaDA 第 29 层/Dream 第 25 层引导,行为与「改写内部时钟」吻合——$\hat{t}>t$ 时置信升、熵降,$\hat{t}90% 方差,3D 形状是计数/时间任务式的有序抛物线;前 2 主成分做子空间引导即复现全向量效果,正交补无相干效应。跨层余弦上 LLaDA 除第 32 层近正交外高度对齐、Dream 分成 3 块(层 1-6/7-20/21-27);层内自注意力与 post-$W_{out}$ 反相关。下游(Table 1):LLaDA 在全部 $\hat{t}$ 下仅波动几个点(GSM8K 84.3→81.0-84.1、HumanEval 44.5→41.6-47.4、StrategyQA 69.5→63.1-69.5);Dream 更敏感,GSM8K 在 $\hat{t}=100$ 从 68.8 塌缩到 23.1,定性分析归因于过早吐出 EOS。

均值引导对下游性能的影响(LLaDA 第 29 层 / Dream 第 25 层)
Table 1: 均值引导对下游性能的影响(LLaDA 第 29 层 / Dream 第 25 层)
LLaDA 第 29 层引导的下游效应
Figure 4: LLaDA 第 29 层引导的下游效应
LLaDA 引导后探针读数跨层漂移
Figure 5: LLaDA 引导后探针读数跨层漂移
均值向量的 PCA 分布与 2D 投影
Figure 6: 均值向量的 PCA 分布与 2D 投影
LLaDA 中 $\hat{t}$ 的共享 2 维几何
Figure 8: LLaDA 中 $\hat{t}$ 的共享 2 维几何
LLaDA 跨层同索引均值向量的余弦相似度
Figure 9: LLaDA 跨层同索引均值向量的余弦相似度
自注意力与 post-$W_{out}$ 向量的平均余弦相似度(LLaDA 第 29 层)
Figure 11: 自注意力与 post-$W_{out}$ 向量的平均余弦相似度(LLaDA 第 29 层)
查看结构化数据
任务指标本文基线提升
GSM8K(LLaDA 引导鲁棒性) 准确率 基线 84.3;$\hat{t}\in\{1,25,50,75,100\}$ 下分别为 81.6/81.0/83.1/84.1/81.0 未引导 84.3 最大跌幅仅 3.3 分,说明沿 $\tau$ 方向引导基本不破坏推理能力
HumanEval(LLaDA 引导鲁棒性) pass@1 基线 44.5;引导后 41.6/47.4/46.0/45.3/46.7 未引导 44.5 部分 $\hat{t}$ 下反而提升($\hat{t}=25$ 升到 47.4)
StrategyQA(LLaDA 引导鲁棒性) 准确率 基线 69.5;引导后 63.1/69.5/66.6/65.3/69.2 未引导 69.5 波动 ±6.4 分内,鲁棒
GSM8K(Dream 引导敏感性) 准确率 基线 68.8;$\hat{t}=100$ 时塌缩到 23.1 未引导 68.8 暴跌 45.7 分,揭示 $\tau$ 信号与 EOS 生成纠缠,过度推进会触发 EOS 连锁退化

局限与改进

作者承认的局限有四。其一,分析只覆盖 LLaDA 与 Dream,二者都用相同的 [MASK] token 交叉熵损失训练,因此 $\tau$ 现象在其他 DLM(如块扩散 SDAR、Fast-DLLM、Block Diffusion)中如何涌现仍是空白。其二,能否在推理时利用 $\tau$ 实现更高效的解码或重掩码策略,作者只留作方向、并未实现。其三,引导的 token 级效应未被分析——他们只看序列级统计量,没回答「哪些 token 怎么变了」。其四,没有定位构建/更新 $\tau$ 的具体电路。我额外观察到两点:Dream 在 $\hat{t}=100$ 因 EOS 塌缩,恰恰说明这个「时钟」并非内容无关的纯进度计数器,而是与「哪些 token 随进度变得更可能」相纠缠(EOS 是最明显的例子)——这既支持、也复杂化了「潜意识时钟」的比喻;另外,熵/置信度/KL 这些下游指标对「模型相信自己在另一步」而言仍是较间接的代理,缺乏更直接的语义层验证。

独立分析的弱点

第一,泛化性未经检验:块扩散模型按块逐步揭示,一个全局标量 $\tau$ 可能定义不良,方法应推广为「每块一个 $\tau$」并验证抛物线几何是否仍成立。第二,「时钟」比喻在极端处失效——Dream 的 $t=1$/$t=100$ 是几何离群点、且 GSM8K 在 $\hat{t}=100$ 因 EOS 塌缩,说明信号与完成/EOS 概率纠缠;改进方向是设计一个与 EOS 方向正交的「纯进度」引导向量,或做 token 类型特异的引导以分离进度与收尾。第三,缺电路级机制:论文证明信号存在且因果相关,但没回答它如何被算出(显式掩码比例估计?分布式序列统计?注意力-MLP 交互?);改进方向是用注意力/MLP 归因或 SAE 定位估计掩码比例并把 $\tau$ 写入残差流的具体头/神经元。第四,评估停留在序列级统计量与 3 个基准上,没展示引导的实用价值(如加速解码、修复退化输出);改进方向是给出一个落地应用,例如用 $\tau$ 读数做自适应步数/早退,证明它「有用」而不仅仅是「可引导」。第五,线性探针在深层塌缩而 MLP 存活,说明 $\tau$ 越深越非线性,给干净可解释性添了难度;改进方向是刻画该非线性(如抛物线暗示的二次型结构)。

未来方向

作者明确提出的方向包括:(1)定位构建/更新 $\tau$ 的电路——是显式掩码比例估计、分布式序列级统计、还是注意力与 MLP 的交互?(2)在推理时利用 $\tau$ 做更高效的解码或重掩码;(3)推广到其他 DLM 家族(块扩散);(4)分析引导的 token 级效应。基于成果可延伸的方向:(a)把 $\tau$ 读数改造成自适应步控/早退控制器——若模型内部「知道」自己快完成了,就跳过剩余去噪步,直接降低延迟;(b)用 $\tau$ 引导来修正 DLM 已知的「U 形解码偏置」(Huang 等 2025 指出基于不确定性的采样会过早吐出 EOS/换行/标点),把退化输出「拉回」;(c)把抛物线几何与吸收态扩散、时间无关掩码模型的理论(Zheng 等 2025;Ou 等 2024)对接,看几何能否从理论推出;(d)基于「自注意力与 MLP 反向表示」这一结构,设计显式维护一个进度寄存器、更高效的 DLM 架构。

复现评估

整体可复现性较好。模型权重公开:LLaDA-1.5 与 Dream 均已发布。探针架构在 Figure 12 中完全给出(5 层残差 MLP,Linear→LayerNorm→GELU,sigmoid 头,宽度 $\min(d,1024)$),仅用 300 条训练/100 条验证样本、20 个 epoch、AdamW(学习率 $10^{-3}$、权重衰减 $6\times10^{-6}$)。硬件需求适中——报告在 NVIDIA H100 与 A100 上完成;探针训练本身很便宜,主要成本在于从模型生成激活(100 bin × 32 层 × 每层大量 token 的隐状态,外加层内组件的钩取)。引导干预是一个简单加法(公式 4),下游度量定义清晰,数据由模型自身生成、无需外部数据集。潜在障碍:写作时未见公开代码,因此精确的生成/解掩码策略、探针超参搜索范围需自行重建;跨层与层内组件余弦分析需要小心地在门控/升维/输出矩阵、自注意力输出、RMSNorm 等中间组件上挂 hook,工程上略繁琐。综合判断:一名有 1-2 块 H100 与公开权重的研究者,可在数周内复现探针+引导的核心结果;完整几何与层内组件分析周期更长。