潜意识时钟:扩散语言模型中的隐式时间建模 Subliminal Clocks: Latent Time Modelling in Diffusion Language Models
扩散语言模型内部潜藏去噪进度信号,可被探针读取与因果引导
前置知识
扩散语言模型(Diffusion Language Model, DLM)
区别于自回归逐 token 左到右生成,DLM 以类 BERT 的方式,从一段全 [MASK] 的回答窗口出发,在 T 个去噪步内逐步把掩码位「揭示」为真实 token。训练时模型接收一个按概率 $s$ 随机打掩码的序列 $x_s$,只在被掩码位置 $\mathcal{M}(x_s)$ 上用重加权交叉熵 $\frac{1}{s}\log p_\theta(x_j^0|x_s)$ 学习预测原始 token。代表性大规模模型有 LLaDA、Dream、MDLM。关键点:与图像扩散不同,这类模型推理时并不把时间步 $t$ 显式喂给网络。
本文全部问题都建立在「DLM 没有显式时间步输入」这一前提上,必须先理解 DLM 的掩码去噪范式才能理解作者在追问什么。
吸收态掩码扩散(Absorbing-State Masked Diffusion)
离散扩散的一种特化形式:噪声过程只把 token 替换成单个特殊的 [MASK]「吸收态」,每个位置独立以概率 $s$ 被掩码。理论上有两个关键性质——反向过程只需去噪掩码位,且得分可写成「干净数据条件分布乘上一个解析的、时间相关的因子」。这使得剩余掩码比例 $1-\tau_t=|\mathcal{M}(x_t)|/L$ 成为去噪进度的天然可观测量。
正是因为理论上掩码比例 $\approx$ 去噪时间,作者才能用经验量 $\tau_t=1-|\mathcal{M}(x_t)|/L$ 作为探针的目标标签,把它当作模型内部「时钟」的可观测代理。
激活探针(Activation Probing)
用一个小的监督模型(本文是带 sigmoid 头的 5 层残差 MLP)以模型某层的某个隐藏状态 $h_{j,l}^{t,n}$ 为输入,去回归一个目标变量(这里是去噪进度 $\tau$)。若探针的 $R^2$ 高,说明该隐藏状态里线性或浅层可读地编码了这个目标。线性探针和 MLP 探针的差距还能揭示信息的「非线性可读性」。
探针是本文回答 RQ1(模型是否内部表示了去噪进度)的核心工具,读懂本文必须理解 $R^2$、Pearson/Spearman 相关以及「单 token 状态回归出序列级统计量」意味着什么。
均值激活向量与表示引导(Mean Activation Vectors & Steering)
把大量样本在「同一去噪步 $t$、同一层 $l$」上的隐藏状态取平均得到 $\mu_{t,l}=\mathbb{E}_{n,j}[h_{j,l}^{t,n}]$,能压掉样本特异噪声、保留系统性信号。引导(steering)即在推理时把当前隐状态朝目标步的均值偏移:$\tilde{h}=h-\mu_{t,l}+\mu_{\hat{t},l}$,由于差值会消去共享层偏移 $\bar{\mu}_l$,从而隔离出 $\tau$ 专属方向。
这是本文回答 RQ2(信号是否因果重要)的核心干预手段,也是验证「均值向量方向 = 模型内部时钟」的关键实验设计,理解差分抵消机制是看懂引导实验的前提。
残差流与表示几何(Residual Stream & Representation Geometry)
残差流是 Transformer 中贯穿各层的主干通道,注意力与 MLP 都从中读写。表示几何用 PCA、余弦相似度等工具刻画激活向量在高维空间中的低维流形形状。本文发现 $\tau$ 的均值向量落在仅 1-3 个主成分就解释 >90% 方差的子空间里,且呈抛物线状。
回答 RQ3(信号有何结构、是否有统一的模型级表示)完全依赖这套几何分析,抛物线、跨层对齐、层内组件余弦相似度等结论都建立在对残差流几何的理解上。
研究动机
扩散语言模型近期被视为自回归模型的有力替代,但与图像扩散有一个根本差异:标准扩散会把时间步 $t$ 显式喂给网络,而以 LLaDA、Dream 为代表的掩码型 DLM 推理时并不接收任何时间步输入。于是自然产生一个被忽视的问题——这些模型到底有没有在内部表示「我现在去噪到第几步了」?现有 DLM 研究绝大多数聚焦效率与生成质量(Fast-DLLM、Block Diffusion、R2-DLLM),少量可解释性工作分别研究了 LLaDA/Dream 上的稀疏自编码器概念引导、注意力下沉随去噪步移动、用操纵 [MASK] 诱导有害生成、以及掩码数量对性能的强烈影响,却都没正面刻画「去噪过程本身的内部动力学」。理论上,吸收态扩散的强表现被归因于 [MASK] 的特殊地位,且掩码扩散目标可改写为关于掩码数量的形式,使连续去噪时间接近掩码比例的松弛。于是「剩余掩码比例」成为去噪进度的天然可观测量,但它是否、如何被模型内部表征依然完全悬而未决——不搞清这一点,就无法解释 DLM 为何有效、无法安全干预、也无法设计更好的解码策略。
本文的目标是本文设定三个层层递进、且尽量可量化的研究问题。RQ1:DLM 内部是否真的编码了一个与去噪步相关的信号?可量化判据是——能否训练探针从残差流以高 $R^2$(例如跨所有层 $R^2>0.5$)恢复出经验去噪进度 $\tau_t=1-|\mathcal{M}(x_t)|/L$。RQ2:这个信号对生成过程是否因果重要?判据是——沿所识别方向引导后,模型置信度、熵、与干净分布的 KL 散度是否按可预测方式(置信度随 $\hat{t}$ 增大而升、KL 近似正比于 $|\hat{t}-t|$)系统性变化,且效果显著强于等范数随机扰动。RQ3:该信号有何结构特征、是否存在统一的模型级表示?判据是——PCA 下能否呈现低维有序几何、跨层余弦相似度是否揭示共享/分块组织。最终目标是对一个去噪进度信号给出「可探测、可引导、被反复校正、且低维结构化」的完整刻画。
与已有工作不同的是,现有 DLM 可解释性工作各有盲区:稀疏自编码器关注概念引导、注意力下沉关注冗余头、掩码操纵关注安全漏洞、长度感知关注下游性能,唯独没人刻画去噪进度信号本身。更广义的表示几何工作(Gurnee 等的计数任务、Engels、Modell、Karkada 等关于流形几何)研究的都是「人类概念」(年份、月份),其几何源于统计共现;而本文抓的是一类完全不同的信号——一个序列级的「元统计量」(未掩码比例),模型为了追踪自身去噪进度而主动重建它。本文的独特切入是:把探针(读信号)、均值向量引导(因果验证信号)、几何分析(刻画信号结构)三件套整合到对单一信号、两个模型(LLaDA、Dream)的统一刻画上,并特别强调引导用的是均值向量差分——它会抵消层共享偏置、把 $\tau$ 专属方向干净地隔离出来。
核心方法
直觉上,可以把 DLM 想象成一位按 100 步工序做菜的厨师:没人告诉它「你现在到第 17 步」,但它也许在脑子里(残差流里)默默拨着一只内嵌的秒表。本文就问三件事——能不能读出这只秒表?能不能把它往前/往后拨、并观察菜品随之变化?这只秒表的表盘长什么样?技术路线分三阶段。第一阶段「探针」:为每一层训练一个小 MLP,输入单个 token 的隐藏状态去回归当前去噪进度 $\tau$,若 $R^2$ 高就说明秒表可读。第二阶段「引导」:对每个 $(t,l)$ 把大量样本的隐状态平均得到均值向量 $\mu_{t,l}$,推理时把当前隐状态替换成 $\tilde{h}=h-\mu_{t,l}+\mu_{\hat{t},l}$,再测熵/置信度/KL 的变化。第三阶段「几何」:对均值向量做 PCA 揭示低维抛物线,用跨层余弦相似度判断 LLaDA 全局共享还是 Dream 分块组织,用层内组件余弦相似度揭示注意力与 MLP 是否反向。整个方法锚定在 $\tau_t=1-|\mathcal{M}(x_t)|/L$ 这个经验量上(附录 A 证明它期望意义下等于训练噪声水平 $s$ 的补)。
核心创新是发现并因果验证:DLM 即便从未被显式喂入时间步,也在残差流里悄悄编码了一只「潜意识时钟」——一个关于去噪进度 $\tau$(未掩码比例 $\tau_t=1-|\mathcal{M}(x_t)|/L$)的潜在表示。它和已有可解释性工作的本质区别有三。其一,研究对象不同:它不是人类概念(年份/月份那种源于统计共现的几何),而是一个模型为追踪自身进度而重建的序列级「元统计量」。其二,干预设计更干净:引导用的是均值向量差分 $\Delta=\mu_{\hat{t},l}-\mu_{t,l}$,由于公共层偏置 $\bar{\mu}_l$ 在做差时抵消,正好把 $\tau$ 专属方向隔离出来;而等范数随机扰动产生的 KL 只有它的一半左右、且无相干趋势,有力排除了「这只是大扰动都会有的副作用」的解释。其三,结构发现具有因果双重支持:信号不仅可读、可引导,还落在仅 1-3 个主成分就解释 >90% 方差的子空间里、呈抛物线,且用前 2 个主成分做子空间引导就能复现全向量的下游效果——说明这只钟确实住在一个极低维、且跨层(LLaDA 除最后一层外)共享的子空间里。
方法步骤详情
步骤一(探针,RQ1):对每层 $l$ 拟合 MLP 探针 $\phi_l:\mathbb{R}^d\to(0,1)$,最小化 $\mathcal{L}_{\text{MLP}}=\mathbb{E}_{t,n,j}(\tau_t-\phi_l(h_{j,l}^{t,n}))^2$;架构是 5 层残差 MLP(Linear→LayerNorm→GELU,sigmoid 头压到 $(0,1)$,宽度 $\min(d,1024)$),300 训/100 验、20 epoch、AdamW($\eta=10^{-3}$、权重衰减 $6\times10^{-6}$);分别用 [MASK]/非 [MASK]/全部 token 训练。输入单隐状态、输出预测 $\tau$。步骤二(均值向量):把去噪离散为 100 bin,按 $\mu_{t,l}=\mathbb{E}_{n,j}[h_{j,l}^{t,n}]$ 算出 LLaDA 3200 个、Dream 2800 个均值向量,并验证 $\phi_l(\mu_{t,l})$ 与 $t/100$ 高度相关(LLaDA 0.976/0.980,Dream 0.962/0.974)。步骤三(引导,RQ2):推理时按 $\tilde{h}_{j,l}^t=h_{j,l}^t-\mu_{t,l}+\mu_{\hat{t},l}$ 扰动,测 $\Delta\bar{S}_t$、$\Delta\bar{c}_t$、$\text{KL}_t$;对照为等范数随机扰动 $\tilde{h}=h+a_{t\to\hat{t}},\,a\sim\mathcal{N}(0,C_{t,l})$。步骤四(几何,RQ3):均值向量做 PCA 投影 2D/3D;用公式 (7) 把 $\Delta$ 投到前 $k$ 主成分子空间及其正交补(各自重缩放到原范数)做子空间引导;再算同索引均值向量的跨层余弦相似度,以及层内组件(自注意力、门控、升维、输出、RMSNorm)间的余弦相似度。
技术新颖性
新颖性体现在三点。第一,这是首次对「去噪进度信号」本身的刻画:先前 DLM 可解释性要么做 SAE 概念引导(Wang 等 2026)、要么研究注意力下沉(Rulli 等 2025)、掩码操纵攻击(Wen 等 2026)、或下游长度感知(Rossi 等 2026),都没碰进度信号;尤其 Zhou 等 2026 发现概念只在某些去噪步可引导,而本文的 $\tau$ 信号贯穿全程且被反复重算,形成鲜明对照。第二,引导方法用均值向量差分抵消了层共享偏置 $\bar{\mu}_l$,比通用的激活加法更干净地隔离出 $\tau$ 方向,并通过「随机等范数扰动 KL 只有约一半」这一对照排除了机械性解释。第三,几何发现把 DLM 与计数/时间任务的流形几何文献(Gurnee、Engels、Modell、Karkada)联系起来——信号呈低维抛物线、在 LLaDA 跨层共享(唯最后一层近正交)、在 Dream 分成 3 个计算块(层 1-6、7-20、21-27),且自注意力与 MLP 带反向表示,这些结构性洞见此前从未在 DLM 上被报告。
实验结果
RQ1(探针):MLP 探针在 LLaDA 全部 32 层保持 $R^2>0.5$(中层峰值约 0.94、首尾略降),Dream 同样跨层高位;[MASK] 略优于非 [MASK] 但两者都高度可恢复,说明 $\tau$ 分布在整个残差流而非局部掩码位。每个探针只看单个隐状态就能恢复序列级 $\tau$;$\phi_l(\mu_{t,l})$ 与 $t/100$ 相关性 LLaDA 达 Pearson 0.976/Spearman 0.980、Dream 0.962/0.974。线性探针深层塌缩到均值基线而 MLP 存活,说明深层信息是非线性编码而非消失。RQ2(引导):在 LLaDA 第 29 层/Dream 第 25 层引导,行为与「改写内部时钟」吻合——$\hat{t}>t$ 时置信升、熵降,$\hat{t}90% 方差,3D 形状是计数/时间任务式的有序抛物线;前 2 主成分做子空间引导即复现全向量效果,正交补无相干效应。跨层余弦上 LLaDA 除第 32 层近正交外高度对齐、Dream 分成 3 块(层 1-6/7-20/21-27);层内自注意力与 post-$W_{out}$ 反相关。下游(Table 1):LLaDA 在全部 $\hat{t}$ 下仅波动几个点(GSM8K 84.3→81.0-84.1、HumanEval 44.5→41.6-47.4、StrategyQA 69.5→63.1-69.5);Dream 更敏感,GSM8K 在 $\hat{t}=100$ 从 68.8 塌缩到 23.1,定性分析归因于过早吐出 EOS。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| GSM8K(LLaDA 引导鲁棒性) | 准确率 | 基线 84.3;$\hat{t}\in\{1,25,50,75,100\}$ 下分别为 81.6/81.0/83.1/84.1/81.0 | 未引导 84.3 | 最大跌幅仅 3.3 分,说明沿 $\tau$ 方向引导基本不破坏推理能力 |
| HumanEval(LLaDA 引导鲁棒性) | pass@1 | 基线 44.5;引导后 41.6/47.4/46.0/45.3/46.7 | 未引导 44.5 | 部分 $\hat{t}$ 下反而提升($\hat{t}=25$ 升到 47.4) |
| StrategyQA(LLaDA 引导鲁棒性) | 准确率 | 基线 69.5;引导后 63.1/69.5/66.6/65.3/69.2 | 未引导 69.5 | 波动 ±6.4 分内,鲁棒 |
| GSM8K(Dream 引导敏感性) | 准确率 | 基线 68.8;$\hat{t}=100$ 时塌缩到 23.1 | 未引导 68.8 | 暴跌 45.7 分,揭示 $\tau$ 信号与 EOS 生成纠缠,过度推进会触发 EOS 连锁退化 |
局限与改进
作者承认的局限有四。其一,分析只覆盖 LLaDA 与 Dream,二者都用相同的 [MASK] token 交叉熵损失训练,因此 $\tau$ 现象在其他 DLM(如块扩散 SDAR、Fast-DLLM、Block Diffusion)中如何涌现仍是空白。其二,能否在推理时利用 $\tau$ 实现更高效的解码或重掩码策略,作者只留作方向、并未实现。其三,引导的 token 级效应未被分析——他们只看序列级统计量,没回答「哪些 token 怎么变了」。其四,没有定位构建/更新 $\tau$ 的具体电路。我额外观察到两点:Dream 在 $\hat{t}=100$ 因 EOS 塌缩,恰恰说明这个「时钟」并非内容无关的纯进度计数器,而是与「哪些 token 随进度变得更可能」相纠缠(EOS 是最明显的例子)——这既支持、也复杂化了「潜意识时钟」的比喻;另外,熵/置信度/KL 这些下游指标对「模型相信自己在另一步」而言仍是较间接的代理,缺乏更直接的语义层验证。
独立分析的弱点
第一,泛化性未经检验:块扩散模型按块逐步揭示,一个全局标量 $\tau$ 可能定义不良,方法应推广为「每块一个 $\tau$」并验证抛物线几何是否仍成立。第二,「时钟」比喻在极端处失效——Dream 的 $t=1$/$t=100$ 是几何离群点、且 GSM8K 在 $\hat{t}=100$ 因 EOS 塌缩,说明信号与完成/EOS 概率纠缠;改进方向是设计一个与 EOS 方向正交的「纯进度」引导向量,或做 token 类型特异的引导以分离进度与收尾。第三,缺电路级机制:论文证明信号存在且因果相关,但没回答它如何被算出(显式掩码比例估计?分布式序列统计?注意力-MLP 交互?);改进方向是用注意力/MLP 归因或 SAE 定位估计掩码比例并把 $\tau$ 写入残差流的具体头/神经元。第四,评估停留在序列级统计量与 3 个基准上,没展示引导的实用价值(如加速解码、修复退化输出);改进方向是给出一个落地应用,例如用 $\tau$ 读数做自适应步数/早退,证明它「有用」而不仅仅是「可引导」。第五,线性探针在深层塌缩而 MLP 存活,说明 $\tau$ 越深越非线性,给干净可解释性添了难度;改进方向是刻画该非线性(如抛物线暗示的二次型结构)。
未来方向
作者明确提出的方向包括:(1)定位构建/更新 $\tau$ 的电路——是显式掩码比例估计、分布式序列级统计、还是注意力与 MLP 的交互?(2)在推理时利用 $\tau$ 做更高效的解码或重掩码;(3)推广到其他 DLM 家族(块扩散);(4)分析引导的 token 级效应。基于成果可延伸的方向:(a)把 $\tau$ 读数改造成自适应步控/早退控制器——若模型内部「知道」自己快完成了,就跳过剩余去噪步,直接降低延迟;(b)用 $\tau$ 引导来修正 DLM 已知的「U 形解码偏置」(Huang 等 2025 指出基于不确定性的采样会过早吐出 EOS/换行/标点),把退化输出「拉回」;(c)把抛物线几何与吸收态扩散、时间无关掩码模型的理论(Zheng 等 2025;Ou 等 2024)对接,看几何能否从理论推出;(d)基于「自注意力与 MLP 反向表示」这一结构,设计显式维护一个进度寄存器、更高效的 DLM 架构。
复现评估
整体可复现性较好。模型权重公开:LLaDA-1.5 与 Dream 均已发布。探针架构在 Figure 12 中完全给出(5 层残差 MLP,Linear→LayerNorm→GELU,sigmoid 头,宽度 $\min(d,1024)$),仅用 300 条训练/100 条验证样本、20 个 epoch、AdamW(学习率 $10^{-3}$、权重衰减 $6\times10^{-6}$)。硬件需求适中——报告在 NVIDIA H100 与 A100 上完成;探针训练本身很便宜,主要成本在于从模型生成激活(100 bin × 32 层 × 每层大量 token 的隐状态,外加层内组件的钩取)。引导干预是一个简单加法(公式 4),下游度量定义清晰,数据由模型自身生成、无需外部数据集。潜在障碍:写作时未见公开代码,因此精确的生成/解掩码策略、探针超参搜索范围需自行重建;跨层与层内组件余弦分析需要小心地在门控/升维/输出矩阵、自注意力输出、RMSNorm 等中间组件上挂 hook,工程上略繁琐。综合判断:一名有 1-2 块 H100 与公开权重的研究者,可在数周内复现探针+引导的核心结果;完整几何与层内组件分析周期更长。
论文图表