← 返回 2026-09-09

早编码,晚启用:Transformer 从哪一层开始作用于推断出的对话伙伴专业度 Encoded Early, Used Late: Where Transformers Begin to Act on an Inferred Partner's Expertise

Mika Okamoto, Gabriele Sarti 📅 2026-09-07 👍 16 2026-09-12 18:30
基础模型科学 对话建模 机制可解释性 激活补丁 线性探针

伙伴专业度在第8层最可解码却因果沉默,第36层后才真正驱动输出。

前置知识

残差流(residual stream)

Transformer 每一层并不直接替换表示,而是把本层计算结果以加法形式写入一条贯穿全网络的共享向量通道,即残差流。由于跨层跳连的存在,早期层写入的信息会原样保留到后面的所有层,即使后续没有任何模块读取它。

这正是本文核心问题的根源:信息在残差流中'可读'不等于'被使用'。跳连让早期写入的特征在深层依然线性可解码,但若没有下游注意力和 MLP 消费它,它就不会影响输出。

线性探针(linear probe)

在冻结的模型中间激活上训练一个线性分类器(本文用 L2 正则逻辑回归),检验某个属性(如对话伙伴的专业水平)能否从该层表示中线性解码。探针准确率衡量的是信息的可解码性,而非该信息是否真正参与计算。

探针是本文定位'属性在哪里被编码'的工具,但论文的关键论点恰恰是:探针找到的最可解码层(第8层)在因果上是沉默的,单靠探针会得出功能定位的错误结论。

激活补丁(activation patching)

一种因果干预方法:把来源样本与目标样本在同一层的激活之差 $\Delta = h^L_{src} - h^L_{tgt}$ 注入目标样本的前向传播,再读出下游变化。若注入某个表征会改变输出,就说明该表征因果地参与了后续计算。

补丁是本文区分'可解码'与'被使用'的核心手段:只有配合干预实验,才能断定第8层早编码的伙伴专业度表征其实不驱动输出,而第36层之后的注入才几乎完全传播到读出层。

推断型属性 vs 陈述型属性

陈述型属性直接写在输入文本里(如'我是教授'),推断型属性则从未被明说,只能从交互方式中逐步积累(如对方写作用词透露的专业度、情绪状态、意图)。两者的表征形成机制在模型内部可能完全不同。

此前'可解码但不被使用'的证据都局限于陈述型属性;本文首次检验推断型属性是否也存在编码层与因果启用层的分离,并发现两者在层深上的差距可以相差很大。

中点过渡(midpoint transition)

Lad 等人(2025)发现的跨模型一致现象:在网络深度中点附近,残差流表征开始与词表空间对齐,中间层是表征从'抽象编码'转向'面向输出'的功能分界。Transformer 深度因此可读作一系列功能阶段的序列。

本文发现的因果启用边界(第20–36层过渡区)恰好落在 Llama-3.3-70B(80层)的中点附近,把'推断属性被写入早但路由到输出阶段晚'的结构性发现与已知的层深组织规律联系起来。

研究动机

研究基础模型内部表征的标准做法是训练线性探针,从中间层解码某个属性,但探针找到的可解码层未必是真正塑造输出的层:残差流通过跳连把早期写入的信息一路复制到深处,即使没有任何下游模块消费它,它在深层依然'可读'。此前关于这种'可读但未被使用'(readable-versus-used)鸿沟的证据全部来自直接写在输入里的陈述型属性——视觉 Transformer 中的图像属性(Huang & Chang, 2025)、稀疏自编码器特征(Arad et al., 2025)、语言模型中的用户属性(Choi et al., 2025)。然而真正驱动模型行为的许多关键属性并不出现在输入文本中,而是模型在多轮交互中逐步推断出来的,例如对话伙伴的意图、情绪状态和专业水平;这类推断型属性最直接的行为后果是隐式个性化与谄媚(sycophancy,Sharma et al., 2024)。它们是否同样存在'编码早、使用晚'的分离,此前完全未被检验。

本文的目标是本文要回答一个因果定位问题:模型从对话中推断出的'伙伴专业水平'这一关系型属性,究竟在 Transformer 的哪一层被编码进残差流,又从哪一层开始因果地驱动输出。具体目标包括三点:构造一个专业度只通过交互方式流露、绝不被明说的多轮研究规划对话语料 EXPERTCOLLAB,从而保证'推断'这一属性成立;在 Llama-3.3-70B Instruct 上用线性探针系统定位专业度可解码的层深,并用陈述型属性(说话者自身水平)作对照;用带内容匹配随机对照和免探针诊断的反事实补丁实验,精确测定该表征开始因果生效的层深边界。

与已有工作不同的是,本文的独特之处在于把'属性的位置'从一个解码问题改造成一个因果问题。已有工作只在陈述型属性上观察到解码层与因果层分离,而本文第一次把这个问题推向必须跨轮次逐步推断的关系型属性。为实现这一点,作者设计了干净的对照结构:EXPERTCOLLAB 中每对对话仅在一名参与者的专业水平上不同(四个水平:高中生、初级研究员、研究员、教授,横跨四个学科领域),角色设定只规定沟通风格和知识盲区、绝不提及任何资历,且用泄露检测器筛查全部28段对话确认无显式证书泄露。这种'仅一个变量不同'的对话对让反事实补丁可以直接注入专业度差异并测量其传播,同时用陈述型的'自身水平'属性作为架构层面的阴性对照,区分'推断属性'与'陈述属性'的层深行为差异。

核心方法

直觉上,要判断一个表征是'仅仅可读'还是'真正被使用',不能只看探针准确率,而要看向该层注入表征差异后输出是否随之改变。技术路线是一个四阶段流水线(fig. 1):第一步 Generate,用同一个模型(Llama-3.3-70B Instruct)分饰两个角色,生成28段、每段12轮的研究规划多轮对话,角色来自四个专业水平(高中生 HS、初级研究员 JR、研究员 R、教授 PROF)和四个领域(如土壤微生物组、GNN、稳健性、缩放定律),并经泄露检测器确认无显式资历陈述;第二步 Extract,在模型即将生成下一轮回复前的'参与者视角'位置抽取残差流激活,每隔四层采样一次(第0到76层,共80层),每层激活维度 $d=8192$;第三步 Probe,对每层训练 L2 正则逻辑回归探针,解码对话伙伴的专业水平,并以说话者自身水平这一陈述型属性作对照;第四步 Patch,利用仅一名参与者专业水平不同的对话对,做反事实补丁测量因果效应。

核心创新是把'表征的位置'当作因果问题而非解码问题来研究,并且首次在推断型属性上完成这一检验。与已有工作的本质区别有三点:其一,此前 Huang & Chang(2025)、Arad et al.(2025)、Choi et al.(2025)观察到的解码-因果分离都针对输入中直接给出的属性,本文检验的是只能从'对方如何写作'中逐步推断的关系型属性;其二,补丁实验配有三重对照——用范数匹配的随机向量替换专业度差异向量,排除'任意扰动残差流都会产生该效应'的平凡解释;用补丁层与读出层相同时效应应约为1来校准度量;用免探针的余弦不相似度诊断(补丁后与未补丁最终层激活的余弦距离)独立复核过渡位置,摆脱对训练出的分类器的依赖;其三,用陈述型的'自身水平'属性做阴性对照,证明架构本身完全有能力无损地把一个陈述属性传递到深层(其准确率在所有层都高于0.60),从而使'伙伴专业度早层衰减'成为可归因于推断性质本身的差异。

方法步骤详情

第一步,构造 EXPERTCOLLAB:生成28段12轮的双人研究规划对话,输入是角色卡(规定沟通风格与盲区,不含任何资历)加领域场景;输出是全部通过泄露检测器(筛查显式证书、头衔等)的语料,两人格由同一模型扮演以消除跨模型风格混淆。第二步,激活抽取:把对话以多轮消息形式输入 Llama-3.3-70B Instruct,伙伴的历史轮作为 user 消息、自己的历史轮作为 assistant 消息,在即将生成下一轮的位置读取残差流 $h^L$,层 $L \in \{0,4,8,\dots,76\}$,两名说话者合并共得到每层56个样本。第三步,探针:对每个层和轮次分别拟合 L2 正则逻辑回归,预测伙伴水平(交叉验证),同时拟合自身水平作为陈述属性对照;另建表面特征基线(仅词面特征)区分词汇线索与深层信号。第四步,反事实补丁:在48个跨水平对话对上,计算 $\Delta = h^L_{src} - h^L_{tgt}$ 并注入目标对话第 $L$ 层残差流,跑完整个前向传播,在第80层固定读出,归一化效应定义为 $E(L) = \frac{p_{patched} - p_{target}}{p_{source} - p_{target}}$,其中 $p$ 为探针对相应类别的置信度,$E$ 接近1表示完全传播、接近0表示无影响;同层补丁同层读出时效应平均为1.01,验证了校准。

技术新颖性

技术新颖性体现在四个层面。第一,问题对象的扩展:把解码-因果分离研究从'输入中陈述的属性'推进到'跨对话轮次推断的属性',这类属性没有对应的具体输入位置,表征必须由模型在生成过程中增量构造,其层深动态可能完全不同,本文证明分离确实存在且更极端。第二,因果度量的设计:$E(L)$ 是一个校准的归一化量,同层对照1.01验证了其无偏性,使得'第8层效应0.01 vs 第40层后超过0.90'这一超过一个数量级的分离具有可比性;配合范数匹配随机对照(无类似上升且置信区间宽得多)排除扰动本身的平凡效应。第三,方法三角互证:线性探针(可解码性)、反事实补丁(因果性)、免探针余弦不相似度(与最终层表征的几何偏离)三种完全独立的度量把过渡位置一致地标在同一区域,说明这是网络的结构性质而非某个方法的伪影。第四,可证伪假设:作者提出编码-因果深度差随属性'需要推断的程度'单调增长的定量假说(附录F),把观察转化为可检验的规律。

The model role-plays both speakers in each EXPERTCOLLAB dialogue (Generate). Activations are taken at the participant-perspective position every four layers (Extract). Linear probes locate where partner expertise is decodable (Probe). Counterfactual patching tests whether that representation propagates to a fixed late-layer readout (Patch).
Figure 1: The model role-plays both speakers in each EXPERTCOLLAB dialogue (Generate). Activations are taken at the participant-perspective position every four layers (Extract). Linear probes locate where partner expertise is decodable (Probe). Counterfactual patching tests whether that representation propagates to a fixed late-layer readout (Patch).

实验结果

实验给出四组互相印证的结果。第一,解码层面:说话者自身水平(陈述型对照)在所有80层中准确率始终高于0.60,说明架构能无损地携带陈述属性;伙伴专业度(推断型)则在第8层达到峰值0.79(四分类,随机水平0.25),到第40层衰减至接近随机;表面特征基线仅0.32,高于随机但远低于探针,说明早层信号超越词汇线索。第二,因果层面:同层补丁同层读出效应平均1.01验证校准;在峰值解码层第8层注入专业度差异,固定在末层的读出几乎不变(效应仅0.01);效应随层深上升,第36层达0.86,第40层起超过0.90,过渡区位于第20–36层,与峰值解码层相差超过一个数量级;范数匹配随机对照无类似上升且置信区间宽得多,证明早期零效应是专业度方向特有的;恢复效应对注入方向对称,且跨轮次、跨领域稳健。第三,免探针诊断:补丁后与未补丁末层激活的余弦不相似度在最初几层平坦,从第8层起陡升,到第32层饱和于约0.40,与因果效应曲线吻合,两种独立读出标定出同一过渡位置。第四,输出层面:晚层补丁使五个最可能的下一词元中约三分之一被改变,而峰值解码层的补丁几乎不触碰输出,直接展示了'可读但不被使用'在生成行为上的后果。

Pooled probe accuracy at the participant perspective. Left: peak cross-validated accuracy by layer. Partner expertise peaks in the early layers and falls to near chance before the midpoint, while the statically specified own-level control stays decodable throughout. Right: accuracy across layers and turns for partner expertise. The early-layer concentration is stable, though the single peak cell is not reliably identifiable at this sample size.
Figure 2: Pooled probe accuracy at the participant perspective. Left: peak cross-validated accuracy by layer. Partner expertise peaks in the early layers and falls to near chance before the midpoint, while the statically specified own-level control stays decodable throughout. Right: accuracy across layers and turns for partner expertise. The early-layer concentration is stable, though the single peak cell is not reliably identifiable at this sample size.
Normalized causal effect by patch layer (48 cross-level pairs). Left: the effect is near zero at the peak-decoding layer, rises through the middle layers, and is near complete by the second half of the network. Right: a norm-matched random control shows no comparable structure, indicating the early-layer null is specific to the expertise direction rather than a generic consequence of perturbing the stream.
Figure 3: Normalized causal effect by patch layer (48 cross-level pairs). Left: the effect is near zero at the peak-decoding layer, rises through the middle layers, and is near complete by the second half of the network. Right: a norm-matched random control shows no comparable structure, indicating the early-layer null is specific to the expertise direction rather than a generic consequence of perturbing the stream.
Effect of counterfactual patching on the model's output: fraction of the five most probable next tokens changed by patching at each layer.
Figure 4: Effect of counterfactual patching on the model's output: fraction of the five most probable next tokens changed by patching at each layer.
查看结构化数据
任务指标本文基线提升
线性探针解码伙伴专业水平(推断型属性) 交叉验证准确率(四分类,随机0.25) 第8层峰值0.79,第40层起衰减至接近随机 表面特征基线0.32;随机0.25 峰值超出表面基线0.47、超出随机0.54,但仅集中于早层
线性探针解码说话者自身水平(陈述型对照) 交叉验证准确率 所有层均高于0.60 随机0.25 证明架构可无损携带陈述属性,凸显推断属性的层深衰减是性质性差异
反事实补丁因果效应(48个跨水平对话对) 归一化效应 $E(L)$(1=完全传播,0=无影响) 第8层0.01;第36层0.86;第40层起超过0.90;过渡区第20–36层 同层校准对照1.01;范数匹配随机对照无结构且区间更宽 峰值解码层与因果启用层分离超过一个数量级
免探针余弦不相似度诊断 补丁后与未补丁末层激活的余弦不相似度 第8层起陡升,第32层饱和于约0.40 最初几层平坦(接近0) 与补丁效应独立地定位到同一过渡层,排除探针伪影

局限与改进

作者明确承认的局限:所有结果基于单一模型(Llama-3.3-70B Instruct)和一个合成的、由同一模型扮演双方角色的语料(28段基础对话),层深边界很可能依赖具体架构;由于语料由后来被探针的同一模型生成,表征可能部分反映模型对自身生成模式的识别而非对'专业度'本身的理解;语料规模小,逐格(层×轮次)估计不可靠——例如图2右侧单个峰值格在该样本量下不可稳定识别,结果应读作层轮廓而非逐点结论。我自己的观察:四档专业水平的离散化是作者强加的标签,模型内部对专业度的连续表征被探针强行四分类,效应量 $E(L)$ 依赖探针校准,探针失准时分子分母同时缩小会放大方差;EXPERTCOLLAB 中'专业度'由模型的刻板写作风格差异承载,与真实人类专家信号(术语密度、引用习惯、不确定性表达等)的差距未验证;'自身水平'对照其实也是模型对人格卡的读取,严格说同样需要推断,只是信息更局部、更接近陈述形式。

独立分析的弱点

弱点一:自举语料问题。EXPERTCOLLAB 由被探针的同一模型生成,'伙伴专业度'的表面实现是该模型自己风格变化的一部分,探针可能学到的是'识别自己的低/高水平写作模式'而非通用的专业度推断。改进方向:用多个不同家族的模型交叉扮演与交叉探针,或引入真实人机对话数据(如不同水平用户与助手的多轮对话日志)做迁移测试。弱点二:样本量与统计功效。56个样本、48个对话对支撑80层的层轮廓,置信区间在随机对照上明显变宽,单个峰值格不可辨识。改进方向:扩大对话数量与领域多样性,用自助法给出层级边界的置信区间,而非只报告点估计。弱点三:单一读出位置。因果读出固定在末层探针置信度,末层探针本身在伙伴属性上接近随机(0.25附近),用它作读出可能低估中层的部分传播。改进方向:补充多个读出深度(如第60/70/80层)和输出 token 分布度量做稳健性检查。弱点四:仅检验一个推断型属性和一个模型。'专业度'可能与谄媚等行为属性共享电路,也可能不共享。改进方向:按附录F假说系统变化属性的显式程度,测因果启始层的单调移动,把观察升级为定量规律。

未来方向

作者提出的方向:其一,显式程度实验(附录F)——通过系统变化属性被提供的显式程度(从完全明说到最后才可推断),检验'峰值解码层与因果启始层之间的深度差随推断负担单调增长'这一可证伪假说,把当前观察转化为定量关系;其二,跨模型复现,检验层深边界是否随架构规模与训练分布移动;其三,对齐应用——以推断伙伴属性为条件的行为(如谄媚)应当在网络后半段被干预引导,而不是在最可读的层,这为基于表征的导向(steering)提供了位置指引。基于本文成果可延伸的方向:把范式推广到其他推断型属性(意图、情绪状态、用户专业知识画像)并比较其因果启始层深;研究早层编码与晚层启用之间的'中继'机制——信息如何在第20–36层过渡区被重新路由进输出通路(可结合注意力头消融与稀疏自编码器定位中继组件);检验谄媚行为是否确实由这些晚层表征介导,从而把'在哪里干预'与'干预什么'连接起来;以及在真实生产对话数据上验证 EXPERTCOLLAB 结论的外部效度。

复现评估

复现条件总体良好但有几处不确定。有利因素:EXPERTCOLLAB 语料在论文中声明会被发布('a corpus we construct and release');模型 Llama-3.3-70B Instruct 开放权重可得;方法全部是标准技术(L2 逻辑回归探针、加性激活补丁、余弦距离),无训练微调,流水线描述详细(每四层采样、56个池化样本、48个跨水平对话对、归一化效应公式与同层校准1.01),附录 B–F 给出语料构建、探针细节、补丁协议、对照与假说。不利因素与算力门槛:正文与提供的材料中未给出代码仓库链接,流水线脚本需自行复刻;70B 模型在半精度下约需 140GB 显存,意味着至少一张 80GB 的 A100/H100 或多卡推理,抽取20层×8192维激活的存储与 I/O 也有一定规模;合成语料依赖模型生成质量,泄露检测器的具体规则在附录 B.5,严格复现需对齐该规则。综合评估:对拥有单张高端 GPU 的研究者,复现主实验(探针+补丁)约在数天内可行,难度中等;跨模型复现则需相应模型的权重访问权限。