解读并调控开源语言模型中的材料科学机制表征 Reading and Steering Representations of Materials-Science Mechanisms in an Open-Weight Language Model
在开源Gemma模型中读出材料科学概念、追踪本构取向的状态变换并因果调控工程决策
前置知识
残差流与隐藏状态
Transformer 的每一层通过注意力与前馈块不断更新一个高维残差向量。Gemma-4 E4B 有 42 层、2,560 维隐藏宽度;中间层的向量并不是句子或思维文字,只有最后一层经最终归一化和固定的输出矩阵(语言模型头)才映射到 262,144 个词表分数。所有层内分析(读出、几何、干预)都作用在这个向量上。
本文的全部测量对象就是这个逐层演化的 2,560 维向量:读出它、比较它在反事实间的位移、或在特定层特定 token 上加减速它。不理解残差流的层编号与状态含义,就无法理解 38–92% 深度带、层 34 读出等实验设定。
Logit lens 与 Jacobian lens
把中间层状态直接通过最终解码器得到词表排序称为直接 unembedding(logit lens),隐含假设早期层已在末层坐标系中。Jacobian lens 则先估计早期状态扰动平均如何传播到倒数第二层(即雅可比映射 $J_\ell$),对该状态施加这层平均下游传输后再过同一个固定解码器。两者输出相同的对象——全词表排名,差别仅在是否建模下游传输。
论文用这两种读出的匹配对比定义『Jacobian 特异性』:任何 Jacobian 阳性结果必须优于同状态的直接读出才算透镜本身的功劳。三个独立 WikiText 拟合(秩相关约 0.998)则用来区分仪器可复现性与科学有效性。
本构关系(直接/反比定律)
材料力学中描述控制量与响应量单调关系的定律:如 Hall-Petch 关系(晶粒细化提高强度)、Orowan 应力(障碍间距减小提高应力)是直接定律;孔隙率增大降低模量是反比定律。用 $s=+1$/$s=-1$ 表示取向,则物理响应符号 = 律取向 $s$ × 数值变化方向 $x$。
论文的核心测试就是模型是否在内部保留这个定性取向:同一个『数值上升』在直接与反比定律下意味着相反的物理后果,而 60 定律基准(20 直接/20 反比/20 中性)正是围绕 $y = sx$ 这一符号分解构造的。
激活导向与激活修补
转向(steering)是在最后提示 token 的某个中间层残差上加或减一个小向量(如残差范数的 ±4%),让模型照常完成前向并观察两个候选答案概率的移动。激活修补(patching)则把一个提示在某层的状态整体替换为另一提示同层的状态,检验移植的状态是否足以改变下游决策。
论文的因果证据全部来自这两类干预:机制方向转向(腐蚀/马氏体/晶粒)、反向关系全状态修补、以及跨尺度的关系坐标中和/替换/恢复实验。没有这些操作,可读性与几何结构都只是相关性。
预注册/冻结协议
在看到模型输出之前固定端点定义、成功规则、对照与统计检验(文中称 frozen),之后新增的分析被显式标记为 post hoc 或 exploratory。推断设计(层级 bootstrap、精确符号翻转检验、结构化零)也在执行前登记。
Table 1 按此给每个实验标注证据等级;注册的宽窗口端点失败(如词法对抗 −0.690)被如实报告,阳性结论(如前瞻晶粒转向 +0.852)才可信。读懂本文的证据分级体系必须先理解这一惯例。
研究动机
大语言模型能答对科学问题,但正确的输出本身并不能说明模型内部是否真正表示并使用了背后的物理机制——答案可能来自有物理意义的表征,也可能来自显眼词汇、记忆关联、数字捷径或输出格式特征。材料科学是检验这一点的严苛场景:推理需要把载荷历史、断口形貌、热处理或晶格形貌等间接证据翻译成底层机制,再组合地外推到新的材料条件,而 Griffith 断裂、Hall-Petch 强化、解理、扩散控制蠕变、韧性等概念相互关联却不可互换。更关键的是,这条推理链包含两个逻辑上不同的操作:先判断输入量如何变化,再套用恰当的本构关系。位错密度升高会提高 Taylor 强化,孔隙率升高却会降低弹性模量,因此同一个『数值上升』在直接与反比定律下意味着相反的物理后果。只能测出『该量增加了』的可解释性度量只识别了一个比较变量,并未触及机制相关的物理结论——这正是本文要拆分的核心。
本文的目标是本文的目标是在开源权重模型上建立一条把『可读性、表征、因果使用』三者分开的证据链,并回答五个问题:(1) 哪些科学词汇能从隐藏状态中可复现地读出,无论是否预先声明目标词;(2) 哪些改进是 Jacobian 传输特有的,而非直接 unembedding 或原始状态的属性;(3) 无选项的状态几何能否组织比较关系,以及当数值方向与本构定律被分开时,绝对几何或匹配的状态变换哪一个能保留本构取向;(4) 冻结的内部方向或移植的状态能否因果地改变科学答案;(5) 哪些结果能跨措辞、答案词表、材料体系和支配机制迁移。作者在 4B 主线上完成全部实验,并在 12B 与 31B 检查点上复制关键的可读性、关系与因果坐标测试;所有主要端点在看到输出前冻结,并配以匹配对照、词法基线与结构化零假设。
与已有工作不同的是,独特切入角度有三点。其一,先前 Jacobian lens 研究只在闭源 Claude 模型和通用语言任务上验证过,本文首次检验该测量能否忠实迁移到开源 Gemma 检查点与间接的材料科学描述,并显式区分『复制方法』与『复制数值模式』。其二,作者不满足于展示有利的几何结构,而是先做无选项图实验、再证明该基准的可识别性极限:提示满足 $y = sx$,家族内配对标签满足 $y_i y_j = x_i x_j$,因此『同物理结果』与『同数值方向』完全混叠,无标签图原则上无法辨认绝对物理极性——这把负结果变成了关于测量对象本身的方法论结论。其三,为绕开该混叠,作者把测量对象从绝对状态换成受控状态变换:比较同一提示只反转数值方向的两个状态之差,用减法消除方程、措辞、数值端点与答案顺序等固定上下文,再用独立的中性定律经验地定义零点与稳健尺度,从而把『模型内部是否保留单调本构取向』变成可注册、可证伪的端点。
核心方法
直觉上,与其追问『模型说了什么』,不如问三件事:模型内部哪些材料概念方向线性可读;当物理输入被反转时状态如何移动;移动这些方向能否改变模型的工程决策。技术路线上,主线模型是 Gemma-4-E4B-it(42 层、2,560 维残差、262,144 词表,bfloat16 推理),辅以 12B(48 层、3,840 维)和 31B(60 层、5,376 维)。读出端同时使用直接 unembedding($s^D = W_U \cdot final\_norm(h_{\ell,t})$)和 Jacobian lens($s^J = W_U \cdot final\_norm(J_\ell h_{\ell,t})$),其中 $J_\ell$ 用反向模式自动微分估计早期状态扰动传播到倒数第二层的平均映射;三个独立 WikiText-103 拟合(每拟合 1,000 条 128-token 记录)提供仪器稳定性。证据链依次为:50 提示受控词汇恢复、无目标词汇发现与盲评、中层状态几何、词法对抗三元组、无选项图与可识别性审计、60 定律中性锚定关系基准、广谱转向筛选与前瞻晶粒确认、全状态修补与因子化跨机制修补、最后是跨 4B/12B/31B 的关系坐标干预。
核心创新有三层。第一,把模型自己的固定输出矩阵当作测量仪器:直接读出与 Jacobian 读出产生完全相同的可测对象——262,144 词表上的排序,二者唯一差别是是否对下游传输建模,这使『Jacobian 特异性』成为可严格检验的匹配对比,而非另一个模型生成的自由解释。第二,从绝对状态转向匹配状态变换:对每条定律构造 8 个配对 cell(两种代数等价方程形式 × 两种材料案例 × 数值增减 × 两种答案顺序),计算 $\Delta r_f = r(h^{up}) - r(h^{down})$,减法消除方程、措辞、数值端点与答案顺序等所有固定上下文;再用 10 条校准中性定律的经验中位数(0.01360)与稳健尺度(0.00854)定义物理零点,破解 $y=sx$ 造成的标签混叠。第三,因果干预的构造保证非平凡性:转向方向由不含答案词的四正四负概念集的 log-sum-exp 对比经梯度回传得到,只在最后提示 token、冻结层、±4% 残差范数的对称剂量上扰动,因此成功无法通过直接添加答案 token 获得。
方法步骤详情
方法步骤如下。(1) 拟合透镜:每个种子用 1,000 条 128-token 的 WikiText-103 记录,按因果性只聚合目标位置 $t' \ge t$ 的雅可比块,得到 25 个源层的映射 $J_\ell$,重复三个独立种子;12B 用目标层 46、31B 用目标层 58。(2) 受控恢复:50 条保留提示(10 机制家族 × 5 描述)× 150 个预声明术语,在 38–92% 归一化深度带记录全词表排名,计算 pass@k($k \in \{1,2,5,10,20,50,100\}$)及对数截止下的恢复 AUC,用家族层级 bootstrap 与 1,024 种家族符号翻转做推断。(3) 无目标发现:扫描所有位置与层的 top-1 解码词,去除输入词、功能词与全局脚手架,要求三拟合共识并按 IDF 加权;再用留一措辞余弦最近质心分类器和 GPT-5.5 盲评验证语义。(4) 几何与图:词法对抗三元组余量 $m_\ell = cos(a_\ell, p_\ell) - cos(a_\ell, c_\ell)$;72 节点有向图(144 边)配 46,656 种平衡标签的结构化零;GIN、谱聚类与 462 种平衡划分穷举做可识别性审计。(5) 关系基准:16 条开发定律拟合单位方向 $d = (\mu^+ - \mu^-)/\|\mu^+ - \mu^-\|$ 与中点 $m$,读出 $r(h) = d^\top(\tilde{h} - m)$,60 条测试定律按 cell 平均得到 $\Delta r_f$,中性锚定校准后报告稳健分。(6) 干预:$h' = h + (a/100)\|h\|_2 d$,$a \in \{-4,-2,0,2,4\}$,答案概率用 teacher forcing 评分;修补直接替换最后 token 残差;坐标干预分中和、单坐标替换、全状态替换、恢复四种操作。
技术新颖性
技术新颖性体现在四个方面。其一,实验文化的严谨度罕见:Table 1 显式区分 frozen、prospective、post hoc 状态,注册的宽窗口端点失败(词法对抗 38–92% 带内 $-0.690$,0/24 三元组为正)被如实报告,其保留的层曲线只作为探索性发现,随后在互不重叠的新队列上前瞻性检验后期窗口。其二,可识别性定理把负结果变成方法论贡献:由于 $s_f^2 = 1$,全局翻转未观测的定律取向 $s_f$ 会反转所有绝对物理标签而不改变无标签图,作者由此建立『科学图无法识别可全局翻转的标签』这一对称性判据,并告诫关系端点不能在混叠于提示变量的情况下被称为独立物理。其三,跨尺度复制拒绝共享坐标系幻觉:12B/31B 各自在自己的隐藏空间用相同的 16 条开发定律重新拟合方向(层 34/39/49,约 83% 归一化深度),31B 内部两个深度的方向余弦只有 0.352,但 60 定律评分的 Pearson 相关达 0.996——关系变量稳定而坐标轴随深度旋转。其四,作者提出把这类测量变成训练奖励时必须防范 readout hacking,要求奖励仪器与评估仪器分离,并用答案脚手架审计给出了具体的风险证据。
实验结果
核心发现按证据链展开。(1) 受控词汇恢复是选择性的:Jacobian 平均恢复 AUC 0.025765 对直接读出 0.012832(相对 +100.8%),但家族级层级 bootstrap 95% 区间 [−0.0187, +0.0486]、符号翻转 p=0.2344 不显著;36/50 提示在两种读出下均为零(11 胜 36 平 3 负);三个独立拟合的秩相关高达 0.9987/0.9980/0.9978,说明仪器可复现但效应稀疏。个案悬殊:腐蚀在三拟合下排名 1/1/1 而直接读出 111;韧性 11 对 12,063;四方 42/42/43 对 35,954;位错 87–94 对 5,262;疲劳则相反(直接第 7,Jacobian 1,279–1,345)。(2) 无目标词汇:盲评自动分类器对两种读出都认出 9/10 机制家族(成对差为 0,均漏解理);严格去污染后留一措辞分类 Jacobian 58%(macro-F1 0.568)、直接 64%(0.615),远超 10% 机会但 prompt TF-IDF 基线达 56%。(3) 中层几何:留一措辞最近质心在层 18(43.9% 深度)达 62%(31/50,p=0.0002,校正零 26%),原始状态 54%,而提示词嵌入基线 76% 更高——家族结构部分是词法的。(4) 词法对抗三元组:注册的宽窗口彻底失败(−0.690,0/24),但冻结的后期减中期变换 +1.402 在 24/24 三元组、6/6 家族为正;直接读出几乎相同(+1.403,对比仅 +0.0039),证明非 Jacobian 特异;答案脚手架审计显示显式选项后分离暴增至 +11.757 log-odds。(5) 无选项图:自然问题端 AUC 0.642(p=0.01235)、边精度 0.674(p=0.02195),但检查点后缀条件 0.486、答案映射后 0.816,跨机制降至 0.513、反数值子集 0.471;可识别性审计证明图内目标与数值方向精确混叠:GIN 绝对极性 AUC 仅 0.259、关系网络 0.507、穷举 462 个平衡划分 ARI 0.022(p=0.087)。(6) 中性锚定关系基准是最强阳性结果:60 定律上反比/中性/直接的稳健分依次为 −2.266/+0.108/+9.669,直接-逆 AUC 1.000、39/40 方向定律正确、ρ=0.910(p=0.00001),词法对照仅 0.505/0.530;去掉方程与两阶段指令后 AUC 仍 0.990、38/40、ρ=0.877,仅毛细上升与成核势垒出错;12B/31B 全部 AUC 1.000、40/40、ρ=0.930,而生成答案准确率分别为 75.8%/64.8%/99.3%——表征与输出转换可分离。(7) 转向:广谱筛选 30 条件上匹配方向效应 +0.451 log-odds(对随机 +0.386,p=0.0040),但只有晶界腐蚀通过全部预注册门;前瞻晶粒实验 6 对材料 12/12 条件正确反转,配对效应 +0.852(0.729–0.988),对无关机制差 +1.351;然而换答案词(increase/decrease,7/12)与反 Hall-Petch 区间(6/12)两个迁移队列失败,23/24 条件移向指定正答案词。(8) 修补:反向关系供体使接收者移动 +6.249 log-odds(5.663–6.795),跨材料 +6.283,等距同关系对照仅 +0.082;因子化跨机制修补物理结果对比 +0.385(p=0.00897)、跨词表 +0.491、反取向 +0.382,但数值方向对比更强(+0.571)且仅 4/6 家族为正。(9) 跨尺度坐标干预:中和单一坐标使正确答案边际下降 4.33/3.05/2.73 logits(4B/12B/31B,激活匹配对照约 0),单坐标反事实替换移动 9.50/7.02/6.47 logits(23/24、24/24、24/24 定律符合预期,p=10⁻⁵),恢复该坐标可移除全状态效应的 54.4%/53.3%/49.6%;4B 上中和翻转 15 个正确决策并修复 2 个(McNemar p=0.00235),12B/31B 离散准确率不受影响。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 受控术语恢复(50 提示 × 150 预声明术语) | 全词表恢复 AUC(对数截止 pass@k 曲线下面积) | Jacobian 三拟合均值 0.025765 | 直接 unembedding 0.012832 | +100.8% 相对提升;但家族级 95% CI [−0.0187, +0.0486] 含零(p=0.2344),为选择性而非普遍优势 |
| 跨措辞机制分类(留一措辞,最严去污染过滤) | 10 类分类准确率 / macro-F1 | Jacobian 58%(F1 0.568);直接读出 64%(0.615) | prompt 词 TF-IDF 56%;平衡机会 10% | 均远高于机会(p<10⁻⁴)但不优于词法基线,无 Jacobian 特异优势(配对 p=0.581) |
| 中层状态几何家族识别(50 描述、25 层) | 留一措辞最近质心准确率 | 62%(31/50,层 18 = 43.9% 深度,p=0.0002) | 原始状态 54%;目标层状态 32%;校正零 26%;提示词嵌入 76% | 对原始状态 +8 个百分点;但不敌词法嵌入基线,结构部分是词法的 |
| 60 定律本构取向(带方程脚手架,4B) | 直接-逆 ROC-AUC / 方向定律正确数 / 秩相关 | AUC 1.000;39/40;ρ=0.910(p=0.00001) | 词 TF-IDF 0.505;字符 TF-IDF 0.530(输出 logit 对照 1.000) | 类别中位稳健分反比 −2.266 / 中性 +0.108 / 直接 +9.669 完整排序 |
| 无方程格式迁移(同 60 定律,去除方程与符号分解指令) | 直接-逆 AUC / 方向正确数 | 0.990(4B,38/40);1.000(12B/31B,均 40/40,ρ=0.930) | 词/字符 TF-IDF 0.515/0.5325(近机会) | 生成答案准确率却为 75.8%/64.8%/99.3%,表征成功与输出转换可分离 |
| 前瞻晶粒细化/粗化因果转向(6 材料对、24 提示、2,400 干预行) | 配对 log-odds 效应(朝物理正确答案) | +0.852 [0.729, 0.988],12/12 条件正确反转 | 随机方向(差 +0.774);无关机制(差 +1.351);直接方向(差 +1.043) | 全部配对 Wilcoxon p=0.03125(6 对可达最小值);半剂量仍 +0.484;但换答案词/反区间队列失败 |
| 无选项图(72 提示自然问题端,144 有向边) | 全候选 AUC / 选中边精度 | 0.642(p=0.01235)/ 0.674(p=0.02195) | 精确结构化零均值 55.6%;词/字符 TF-IDF 在零水平或以下 | 但检查点后缀 0.486、答案映射后 0.816,且可识别性审计证明目标与数值方向混叠 |
| 反向关系全状态修补(晶粒队列,38–92% 带平均) | 向供体答案的 log-odds 位移 | +6.249 [5.663, 6.795](同材料反向供体);跨材料 +6.283 | 等距同关系对照 +0.082;等距答案顺序对照 +1.055 | 对两对照差 +6.166 / +5.193;峰值约 11 log-odds;与 Jacobian 可读分离相关 ρ=0.818 |
局限与改进
作者承认的局限相当坦诚:主线词汇、图与最初转向实验集中在 4B 检查点,31B 只有一个透镜拟合,Jacobian-直接对比跨尺度不一致;Jacobian 映射用通用 WikiText-103 拟合,非常用技术词汇的激活方向可能覆盖不足,且现有设计无法把测量限制与模型本身的可及性限制分开;目标自由过滤仍会漏进词片段与通用词;自动盲评是一个模型重复五次而非材料专家小组;受控恢复零膨胀,多 token 技术词(martensite、transgranular)的完整序列检验未过广度门(7/10);词法对抗复制的注册主端点失败;图重用已检视的 72 提示队列并含精确标签混叠;60 定律关系基准重用定律身份、约束答案集,中性类是人工设计而非自然语篇,毛细上升仅在 4B 格式对比中反转、成核势垒两种格式都失败;生成答案准确率跨尺度波动(64.8%–99.3%)且 12B 中性答案仅 2.5% 正确;坐标干预只用单一后期层、二元答案与已知单调关系。我的补充观察:所有抽象证据都是任务引发的——提示仍指名响应量与控制量并给约束答案词,因此结果支持的是受约束决策中的定性取向计算,而非自发或量化的物理推理;转向对答案词表与物理区间的脆弱性(23/24 条件移向指定正词)提示单一冻结方向更像上下文相关的决策通路,而非可复用的机制算子;此外 60 定律的『迁移』本质是格式迁移,对全新定律的泛化仍未被检验。
独立分析的弱点
独立分析的弱点:(1) 定律身份在带方程/无方程/跨尺度条件间完全重用,所谓迁移是格式迁移而非对新定律的泛化——改进方向是保留整个定律族(如全部 Hall-Petch 系)做真正留族测试。(2) 答案空间被约束为两个单 token 词,模型可能把任务简化为二选一证据累积——应测试自由格式与数值预测答案。(3) 中性锚定方向 $d$ 是一维线性质心差,只能表达单调符号,无法表达系数、量纲或非线性饱和(如反 Hall-Petch 交叉本身需要第二个机制)——可扩展为分段或低秩子空间读出。(4) 转向方向在换词表/换区间时失效,说明干预向量部分编码了与 higher 绑定的决策特征而非纯物理——改进方向是在多答案词、多物理区间上联合拟合不变方向,或用因果中介分析分离词汇成分与物理成分。(5) 自动盲评依赖与 Gemma 可能共享网络先验的单一 GPT 模型,五个重复不是独立专家——应换用多个独立训练的评审模型并引入材料专家面板。(6) 论文提出的表示感知奖励方案完全未做实验验证,readout hacking 风险只在答案脚手架审计中有间接证据——需要真正的微调对照实验(仅结果奖励 vs 结果+表征奖励 vs 组合目标)来证明可行性。
未来方向
作者提出的方向:(1) 下一代表征研究应保留整族定律、移除约束答案词汇、在无选项提示边界上同时测试定性取向与方程预测的分级幅度,且幅度需与原始数值差和词法相似度去相关;(2) 分层多路图——一层按推断的支配机制连接提示、一层编码带符号与分级响应、一层连接兼容的量纲/单位/边界条件,同一节点跨深度追踪,超边表示『工艺→结构→机制→性能』链条(如热处理→析出间距→位错绕过→屈服强度);(3) 表示感知训练奖励 $R = R_{answer} + \lambda_m R_{mechanism} + \lambda_c R_{counterfactual} + \lambda_s R_{specificity} + \lambda_u R_{uncertainty} - \lambda_\ell R_{lexical\ shortcut}$,配套反 readout-hacking 的仪器分离、保留机制评估与专家复核;(4) 不确定性奖励:在相边界或反 Hall-Petch 交叉附近奖励保留两个竞争机制假设的校准内部状态,而非过早收敛到单一词汇,并可延伸到实验选择建议;(5) 跨架构比较 Llama、Mistral、OLMo 及材料微调模型。基于本文成果可延伸:把受控状态变换端点用作模型科学可靠性的诊断工具,区分正确答案靠物理还是靠捷径;把关系坐标的中和/修复操作用于定位并修复幻觉决策;将中性校准思想推广到化学、生物等其他领域的单调关系;以及在更大定律库上检验取向表征是否随规模出现质变。
复现评估
复现条件较好。开源情况:模型为开放权重 Gemma-4 E4B/12B/31B(论文固定了不可变 revision,bfloat16 推理);三个 Jacobian 透镜检查点发布在 HuggingFace lamm-mit/gemma4-jacobian-lenses;潜向量数组在 lamm-mit/gemma4-materials-latent-vectors;提示集在 lamm-mit/gemma4-materials-mechanism-prompts;代码、确切提示清单、版本化协议、原始模型输出与分析脚本在 GitHub lamm-mit/Substrates。数据:50 提示保留集、24 词法对抗三元组、60 定律清单、960×2,560 状态数组等全部机器可读归档,多数后期分析(图审计、可识别性、划分穷举)无需重新前向传播即可复算。算力:单张 Linux GPU 即可,文中明确支持在 Apple silicon 上以 -device mps 运行;透镜拟合每种子仅 1,000 条 128-token 记录,规模不大。难度:中高——概念与协议分支极多(frozen/prospective/post hoc 分级、结构化零、46,656 种标签枚举等),需严格按论文顺序执行冻结协议才不破坏统计效力;好在 Materials and Methods 给出了约 25 条逐命令的运行手册(run_lens.py、run_mechanism_steering.py 等),显著降低工程门槛。跨架构复现需注意 tokenizer 与输出头差异,方向须在各模型自身坐标系内重新拟合。
论文图表