← 返回 2026-09-10

SAEScientist-Bench:评测 AI 智能体能否自主开展 SAE 可解释性研究的基准 SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?

Yuqiao Tan, Shizhu He, Jun Zhao, Kang Liu 📅 2026-09-08 👍 19 2026-09-12 18:30
AI智能体基准 机制可解释性 激活转向 特征发现 稀疏自编码器SAE 递归自我改进

首个把智能体当“SAE 科学家”考试的基准:概念选择性逼近专家,因果转向严重落后

前置知识

稀疏自编码器(SAE)

加在语言模型隐藏状态上的无监督模型:编码器把 $h$ 映射为稀疏非负向量 $z$,解码器以 $\hat{h} = b_{\mathrm{dec}} + \sum_f z_f d_f$ 重构。理想时每个坐标对应单语义特征方向 $d_f$,将多义激活分解为可解释特征;Gemma Scope 即此类实现。

整个基准就是让智能体在 131,072 个 SAE 特征中为给定概念找出最优特征,三个评测维度(Rank/Activation/Steering)全部定义在 SAE 的激活值和解码器方向之上,不懂 SAE 无法理解任务与打分。

Gemma Scope 预训练特征字典

DeepMind 发布的开放 SAE 库,为 Gemma 2 各层预训练了不同宽度的字典。本文固定用 Gemma-2-9B-IT 第 9/20 层残差流上宽度 131,072 的 SAE,每个特征有唯一 ID,激活值量化概念的表达强度;字典巨大意味着搜索空间和“被无关特征淹没”的风险都很大。

智能体的全部探索都发生在这本 131K+ 特征字典里,Rank 指标衡量所选特征在整本字典中的激活排名,字典规模直接决定任务难度与评分含义。

激活转向(Activation Steering)

因果干预手段:推理时把特征方向按强度 $\alpha$ 加到隐藏状态,$h \leftarrow h + \alpha d_f$,再继续生成;对比前后输出即可检验该特征是否真正改变行为。本文还用范数相同的随机高斯向量作对照,排除“任何扰动都有效”的假阳性。

Steering 是三个评测维度中最难的一项,也是论文核心结论(智能体最高仅 31.47 vs 专家 57.75)的来源,它把表示空间中的相关性与真正的因果控制力区分开来。

AUROC

ROC 曲线下面积,即随机取一正一负样本时正样本得分更高的概率:1.0 完美分离,0.5 等同随机。本文用它衡量特征激活能否把正文本与(困难负例+中性)对照分开,缩放为 $\mathrm{Activation} = 100 \times \max(0, 2\,\mathrm{AUROC}-1)$。

Activation 维度直接由 AUROC 决定,是智能体最接近专家的指标;论文还对比了最大 token 与 top-3 token 均值两种聚合方式对 AUROC 的影响,是理解 5.3 节分析的关键。

递归自我改进(RSI)与表征审计

RSI 指智能体自主发现、训练并迭代改进前沿模型的闭环。现有 RSI 基准几乎只自动化数据、算法与后训练等经验流程,把被改模型当黑盒、只看外部任务指标,易受奖励劫持、规约博弈和欺骗性对齐影响。表征审计指用白盒工具持续检查模型内部学到了什么,被视为可信 RSI 缺失的支柱。

论文把本基准定位为 RSI 闭环中的“事后监控/审计”能力测评:判断智能体能否科学检查模型内部表征,这决定了它是否配得上真正的自主 AI 研发闭环。

Neuronpedia 与专家参考特征

公开的 SAE 特征浏览与转向预设平台,为 Gemma Scope 每个特征提供激活示例与人工解释。本基准 20 个专家参考特征(Expert)全部锚定于此:部分直接取自公开 steering 预设(如 Cat),其余经专家筛选流程验证;Expert 综合分 85.56,是所有打分的参照基线。

评测本质上是拿智能体提交的特征与 Expert 在激活排名、选择性和转向三方面对比,Expert 的选取与冻结方式直接决定基准的公正性。

研究动机

递归自我改进(RSI)研究目前几乎全部在自动化训练流水线——数据整理、算法设计、后训练(如 MLE-bench、PaperBench、PostTrainBench 等),把不断进化的模型当黑盒,仅凭外部任务指标驱动优化。这种纯外部优化极易被奖励劫持、规约博弈和欺骗性对齐钻空子:模型可以分数很高却藏着非预期行为。随着模型规模增大、内部机制愈发不透明,行为观察已不足以诊断失败或保证对齐;缺少白盒审计工具时,自主迭代循环可能不断强化伪捷径与不可检测的安全失败。另一方面,虽然已有智能体能做特征发现或电路分析(如 SAGE、Anthropic 审计智能体等),社区始终缺乏一个标准化基准来严格评测“用 SAE 工具做机制发现”这一科学能力本身。

本文的目标是本文构建 SAEScientist-Bench,把 AI 智能体当作“科学家”来考试:给定一个目标概念(葡萄牙语、猫、报税语言、临床症状报告等 17 个概念),智能体需自行设计对比探针文本,在 Gemma-2-9B-IT 第 9/20 层 Gemma Scope SAE 的 131,072 个特征中自主探索,并提交一个最优特征 ID。评测端用冻结的评估套件(正文本、困难负例、中性对照、20 条转向指令)和锚定于 Neuronpedia 的专家参考特征,从激活排名(Rank)、概念选择性(Activation)与因果转向(Steering)三个互补维度统一打分,把“实验性的模型理解”变成可测量的能力,为闭环自主 AI 研发补上表征审计这一缺失支柱。

与已有工作不同的是,切入点独特之处在于:评测对象不是 SAE 字典本身的质量(那是 SAEBench 的事),也不是解释文本的流畅度,而是智能体做机制可解释性研究的“科学过程”——提出假设、设计对比实验、解读测量结果、在精度与覆盖间做取舍。与把模型当黑盒的训练类智能体基准(MLE-bench、RSI Bench 等)不同,本文聚焦白盒表征审计;与一次性的自动神经元解释(Bills et al., 2023)不同,智能体要在多轮交互中主动设计困难负例(如用英语谈葡萄牙语、Copycat killer 这类子串干扰),并接受因果转向的最终检验。这是首个把“对比探针设计 + 大字典导航 + 因果验证”串成闭环考卷的基准。

核心方法

直觉上,论文把一位可解释性研究员的日常拆成一张标准化考卷:拿到概念 → 猜哪些文本能激活它 → 设计反例排除表面相关 → 在字典里检索并对比候选 → 提交最终答案,再由考官盲评。技术上,每个任务绑定一个(概念,SAE 层)对:Gemma-2-9B-IT 第 9 与 20 层共 20 个任务、17 个概念(6 个语言、猫、园艺建议、财报、报税、投资组合、招聘、房产、天气、考古发掘、临床症状、药物剂量)。智能体拿到概念描述、模型/SAE 标识、hook 点与字典宽度,通过 probe_sae 接口每次最多提交 64 条自写文本,可获取 top-k 激活特征或测量指定候选,最后提交一个特征 ID;任务限时 60 分钟,禁止联网。评估器在冻结评估集上测三个分数并与 Expert 对比,综合分取三维等权平均 $\mathrm{Overall} = (\mathrm{Rank} + \mathrm{Activation} + \mathrm{Steering})/3$,Expert 基线为 85.56。

核心创新是“专家锚定的三维度评分体系”,各惩罚一种失败。Rank(突出性):取正文本 top-3 token 激活均值求字典平均排名,按 $\mathrm{Rank} = 100 \times \frac{2 r_{\mathrm{exp}}}{r_f + r_{\mathrm{exp}}}$ 相对专家缩放,100 分即与 Expert 平齐,惩罚“分离得好却排不上号”。Activation(选择性):$\mathrm{Activation} = 100 \times \max(0, 2\,\mathrm{AUROC} - 1)$ 衡量正文本与困难负例、中性对照的分离,惩罚概念与格式混淆。Steering(因果性):同一指令下分别用原始模型、干预 $h \leftarrow h + \alpha d_f$ 与范数匹配随机方向生成,GPT-4o 盲评目标相关性(0–4)后取净增益 $\mathrm{Steering} = 100 \times \max(0, \frac{T_f - \max(T_{\mathrm{base}}, T_{\mathrm{random}})}{4})$。

方法步骤详情

流程五步。第一步任务构建:为每个概念配正文本、困难负例(如用英语谈葡萄牙语)、中性对照与 20 条转向指令并全部冻结,配 Neuronpedia Expert 特征(如葡萄牙语 41424,冻结强度 $\alpha_E=160$)。第二步智能体探索:读概念说明,多轮调用 probe_sae——自写探针文本检索 top-k 特征或测量候选列表,迭代修订假设(每配置 60 个评分片段 = 20 任务 × 3 次独立运行)。第三步提交一个特征 ID。第四步激活评估:在冻结评估集上算文本级激活(top-3 token 均值)、字典排名与 AUROC,换算 Rank 与 Activation。第五步转向评估:先在 5 条留出提示上校准 $\alpha$(网格 $\{0.5,...,1.5\}\alpha_E$,须 ≥90% 非退化输出,否则降档),随机对照用同一刻度;再在 20 条指令上贪心生成,GPT-4o 温度 0、匿名盲评两遍得 Steering;基准分对 20 个任务等权平均。

技术新颖性

技术新颖性有四点。其一,评测对象从“产物”转向“科学过程”:不只打分最终特征,还通过 600 个片段的行为日志(检索调用、探针文本、候选测试、回头再检索比例)刻画各模型的研究风格——Sol 平均写 115.1 条探针文本却只测 20.2 个候选,Opus 5 反之以 77.6 条文本筛 80.2 个候选,Kimi K3 检索仅 1.7 次却精准命中。其二,测量设计讲究:文本级激活用 top-3 token 均值而非单 token 最大值,可抑制孤立词汇尖峰(Sol 的词表对照出现 5.56 的单 token 尖峰,使 max 聚合 AUROC 降到 0.969,top-3 均值恢复 1.000)。其三,Steering 用范数匹配随机方向作对照并只计净增益,杜绝“乱加向量也有效”的假阳性。其四,Rank 以 Expert 排名为锚做相对缩放,能区分“AUROC 同为 1.000 但字典内强度天差地别”的特征——Sol 与 Expert 的 Rank 因此是 3.97 vs 100。

SAEScientist-Bench workflow.
Figure 2: SAEScientist-Bench workflow.
Benchmark coverage.
Figure 3: Benchmark coverage.

实验结果

10 个前沿智能体在 20 个任务上各跑 3 次的结果:Kimi K3 以综合 65.82 居首,Opus 5(65.41)、Sonnet 5(65.04)、Grok 4.6(62.93)随后,Expert 基线 85.56,全员明显落后。维度分化显著:Opus 5 字典排名最佳(Rank 75.35 vs 100),Kimi K3 选择性最高(Activation 92.91 vs 98.92,几乎追平),Grok 4.6 转向最佳但仅 31.47 vs 57.75——因果干预是普遍短板。案例揭示典型失败:葡萄牙语任务中 Sol 选出 Steering 88.75(超专家的 85)但 Rank 仅 3.97 的特征;Opus 5 的特征在英文对照上激活 4.50 反超目标 3.81,Overall 崩至 13.91;GLM-5.2 在临床症状任务把无症状病史文本上 70.25 的激活误判为可忽略,选中“格式”特征;Cat 任务中 Opus 5 用 Copycat killer 等负例识破子串“cat”假特征。Overall 与 AA 智能指数 v4.2 秩相关 ρ=0.800。

Agent scores and rankings on Rank, Activation, Steering, and Overall across 20 tasks.
Table 1: Agent scores and rankings on Rank, Activation, Steering, and Overall across 20 tasks.
Authored contrastive probes and case-level discovery scores on Portuguese (Layer 9).
Table 2: Authored contrastive probes and case-level discovery scores on Portuguese (Layer 9).
Opening excerpts under Portuguese steering.
Table 3: Opening excerpts under Portuguese steering.
Task concepts and Expert IDs.
Table 4: Task concepts and Expert IDs.
Agent models and execution harnesses.
Table 5: Agent models and execution harnesses.
Component scores for GPT-5.6 Sol's Portuguese selection.
Table 6: Component scores for GPT-5.6 Sol's Portuguese selection.
Frozen generation and steering settings.
Table 7: Frozen generation and steering settings.
Concept-specific criteria in the steering judge's system message.
Table 8: Concept-specific criteria in the steering judge's system message.
Real-estate candidate trade-offs and evaluation.
Table 10: Real-estate candidate trade-offs and evaluation.
Probing traces from Claude Opus 5 on Cat and Tax Filing tasks.
Table 12: Probing traces from Claude Opus 5 on Cat and Tax Filing tasks.
Selected Portuguese features and task-level Steering scores.
Table 16: Selected Portuguese features and task-level Steering scores.
Activations on all Portuguese evaluation texts.
Table 17: Activations on all Portuguese evaluation texts.
Target effect, instruction preservation, and degeneration of non-Expert selections on 13 tasks.
Table 22: Target effect, instruction preservation, and degeneration of non-Expert selections on 13 tasks.
Spearman rank correlation of benchmark scores with the AA Intelligence Index.
Table 28: Spearman rank correlation of benchmark scores with the AA Intelligence Index.
Repeated feature selections and mean versus best Steering across three runs on 20 tasks.
Table 29: Repeated feature selections and mean versus best Steering across three runs on 20 tasks.
SAEScientist Agent Index.
Figure 1: SAEScientist Agent Index.
Autonomous scientific search workflows across frontier agents.
Figure 4: Autonomous scientific search workflows across frontier agents.
Generalization and aggregation sensitivity of discovered Portuguese features.
Figure 5: Generalization and aggregation sensitivity of discovered Portuguese features.
Causal steering and instruction preservation under Portuguese feature intervention.
Figure 6: Causal steering and instruction preservation under Portuguese feature intervention.
Per-agent search outcomes across 60 episodes each.
Figure 7: Per-agent search outcomes across 60 episodes each.
AUROC by control type and nonzero activation by text type.
Figure 9: AUROC by control type and nonzero activation by text type.
Mean Steering for every agent and task.
Figure 10: Mean Steering for every agent and task.
Overall and Steering within each task category.
Figure 11: Overall and Steering within each task category.
Steering scores across independent discoveries of four concepts.
Figure 12: Steering scores across independent discoveries of four concepts.
查看结构化数据
任务指标本文基线提升
综合发现能力(20 任务等权均值) Overall = (Rank+Activation+Steering)/3,0–100 Kimi K3 65.82 ±1.87(第 1 名) Neuronpedia Expert 85.56 无提升:仍落后专家 19.74 分(约为专家的 77%)
概念选择性(Activation) Activation = 100×max(0, 2·AUROC−1) Kimi K3 92.91 ±1.07(第 1 名) Expert 98.92 差距仅 6.01 分,智能体最接近专家的维度
字典激活排名(Rank) Rank = 100×2r_exp/(r_f+r_exp) Claude Opus 5 75.35 ±0.14(第 1 名) Expert 100.00 无提升:落后 24.65 分
因果转向(Steering) Steering = 100×max(0,(T_f−max(T_base,T_random))/4) Grok 4.6 31.47 ±3.39(第 1 名) Expert 57.75 无提升:落后 26.28 分(仅为专家的 54.5%),差距最大的维度
葡萄牙语单任务案例(Layer 9) 任务级 Steering(GPT-4o 盲评净增益) GPT-5.6 Sol 88.75(特征 49607) Expert(特征 41424)85.00 单案例超越专家 +3.75,但该特征字典 Rank 仅 3.97 vs 100,Overall 64.24 vs 95.00
与通用智能的关系(4 个可比模型) 与 AA Intelligence Index v4.2 的 Spearman 秩相关 ρ Overall ρ=0.800;Activation ρ=1.000 证明白盒机制发现能力与通用智能正相关但维度独立(Rank 与 Steering 仅 ρ=0.400)

局限与改进

作者承认三点:基准只覆盖 Gemma-2-9B-IT 两层(9/20)残差流 SAE 的概念驱动单特征发现,probe 接口固定;评估依赖固定文本套件、冻结专家基线与 GPT-4o 自动评委,评分有噪声;目前只做事后审计,尚未接入模型编辑、遗忘或持续对齐闭环。我的补充:其一,20 个任务规模小且语言类占 6 个,Cat 任务全员 Steering 同为 43.8、财报 L20 全员 74,部分任务区分度饱和而部分语言任务全员近零,难度两极化;其二,Steering 依赖单一 4o 评委与表 8 的概念判定标准,系统性偏差未消除;其三,Expert 用冻结 $\alpha_E$ 而候选走校准网格,且房产任务中 Expert 的 Target Effect 仅 0.394,说明 Expert 未必是转向上限;其四,无法排除前沿模型预训练见过 Neuronpedia/SAE 内容造成的污染——虽断网并匿名化 Expert,“恰好选中 41424”仍可能是记忆而非发现;其五,Rank 量程 [0,200] 且对排名极敏感(Sol 仅 3.97),单维度分数可解释性有限。

独立分析的弱点

独立分析有四个弱点。第一,因果验证深度不足:Steering 只做生成端加法干预并依赖 0–4 盲评,没有激活抑制(ablation)、方向消融或跨层交叉验证,对“是否真因果”的判定仍较粗;改进方向是引入 activation patching / causal tracing 等多重干预证据并加权打分。第二,探针接口受限:每次最多 64 条文本、评估集完全冻结,智能体无法请求“哪类文本最能区分候选 X 与 Y”的定向实验,也不能跨层或跨字典搜索,能力上限被接口卡死;可改为开放式实验接口并支持多层联合发现。第三,任务区分度不均:如图 10 所示部分任务全员同分或全员零分,难以拉开差距,应补充难度连续、概念边界更细的任务(如多特征组合、抑制型概念)。第四,重复性偏低:三次运行中三次选择一致的比例仅 20%(GLM-5.2)到 55%(Gemini 3.8 Flash),平均与最佳 Steering 差 4.23–14.53 分,单次跑分对“自主科学家”能力的估计方差很大;此外 GLM-5.2 误读实验数据的失败提示应把“证据解读”拆成独立子能力单独评测与训练。

未来方向

作者提出的方向:扩展到更多模型家族、更宽字典、多特征电路发现,以及不预设概念的开放式假设生成;引入人在环路验证、多参考特征与多评委集成以降低评分噪声;把发现的特征接入下游模型编辑、遗忘(unlearning)与持续对齐,形成真正闭环的 RSI 审计。基于本文成果可延伸的研究:其一,把“证据解读”显式化为训练目标——用 600 个片段的轨迹构造 SFT/RL 数据,教模型正确读取 activation/rank 并识别格式假阳性(GLM 病例即 70.25 的非症状激活被无视);其二,训练“转向效力预测器”,从激活统计直接预测因果效力,弥合 Rank/Activation 与 Steering 之间的鸿沟(Sol 案例:AUROC 1.000 但 Rank 仅 3.97,说明选择性不代表可转向性);其三,把优秀智能体的对比探针设计提炼成自动困难负例合成算法,抬高所有智能体的下限;其四,跨层/跨模型迁移研究:第 9 层发现的语言特征在第 20 层是否有对应,Gemma 的 Expert ID 在 Llama/Qwen 的 SAE 字典中是否有同概念镜像。

复现评估

复现条件较好:代码开源于 GitHub(Trae1ounG/SAEScientist),Gemma-2-9B-IT 与 Gemma Scope 公开,Expert 特征锚定 Neuronpedia 可逐个核对(全表见附录表 4,如葡萄牙语 41424、猫 62610)。协议描述很细:三个打分公式、top-3 token 聚合、$\alpha$ 校准网格与三阶段过滤、GPT-4o 评委完整 prompt 及各概念的强/弱证据标准(表 8)全部给出;档案保留 600 个片段、4,873 次探针调用与完整生成文本。算力上需要能跑 9B 推理与逐 token 干预的 GPU(转向评估 124 对任务-方向、10,940 条生成),外加 GPT-4o 评委 API 费用(14,880 次评分)。门槛在于:冻结评估文本套件需按论文描述构建或从仓库获取;智能体端还需 Cursor/Codex 等商用 harness 与各模型 API。总体中等偏易:协议透明、组件公开,但完整复现排行榜需可观预算。