← 返回 2026-08-13

Mechanist:作为发现智能机制科学仪器的AI系统 Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

Mengru Wang, Junfeng Fang, Shuofei Qiao, Zhenqian Xu, Haoming Xu, Haoxiong Wang, Shumin Deng, Linyi Yang, Zhixiang Cui, Xin Xu, Yunzhi Yao, Buqiang Xu, Fei Shen, Haozhe Luo, Yunxiang Wei, Ningyu Zhang, Julian McAuley, Tat Seng Chua, Huajun Chen 📅 2026-08-12 👍 84 2026-08-18 18:30
AI for AI AI安全 AI智能体 信念机制 机制可解释性

把AI当科学仪器:多智能体自主发现、验证并干预大模型内部机制

前置知识

机制可解释性

机制可解释性试图打开神经网络黑箱,找出模型内部具体组件(注意力头、神经元、特征方向、回路)与外部行为之间的因果对应关系。常用手段包括稀疏自编码器学习特征字典、激活修补、消融实验和回路发现等,目标是把“模型为什么这样回答”还原为可验证的计算机制。

本文整个系统就是为自动化这类研究而建:知识图谱、32个方法技能库和四个案例全部围绕机制分析展开,不理解这一领域就无法理解论文的动机与评估标准。

因果干预与消融

与只观察相关性的归因方法不同,因果干预直接修改模型内部:消融把某个组件置零,激活修补用反事实输入的激活替换原激活,然后观察行为变化。若关闭组件 $h$ 使目标能力骤降而其他能力(如通用语言建模困惑度)基本不变,即可声称 $h$ 对该能力有因果作用。

论文中定位信念头、验证Evo2内部特征的作用全部依赖这类干预;Verification Agent 判断实验是否可靠的核心标准之一,就是“是否做了真正的干预而非仅相关性证据”。

稀疏自编码器(SAE)

SAE 把模型稠密激活分解为大量稀疏的、往往对应单一概念的“特征”,每个特征是一个字典原子。训练好后可以做特征看板和归因图,也可以在推理时放大某个特征的激活来引导模型输出方向,称为特征引导(feature steering)。

案例四中 Mechanist 正是从 Evo2 的 SAE 特征库中检索出与 α-螺旋相关的特征并在 DNA 生成时激活它,实现对生物序列生成的定向控制,这是理解跨学科设计案例的前提。

阈下学习

阈下学习指行为特质经由语义上与该特质无关的训练数据从教师模型传给学生模型:教师因微调或系统提示带有某偏好,它生成的中性数据(如数字序列、代码)在清洗后仍会把偏好传给同源初始化的学生。这说明存在数据语义之外的隐蔽统计传导通道。

这是案例一的现象基础。已有工作只证明“中性文本数据”可传偏好;Mechanist 把它扩展到“语义对立数据+跨模态”,发现了绕过内容安全筛查的新风险。

Fisher 信息定位

Fisher 信息衡量输出对参数扰动的敏感度。本文用经验 Fisher 分数 $F_i^{(T)} = \frac{1}{|\mathcal{D}_T|}\sum_{(x,g,d)}\left(\frac{\partial s_\theta(g\mid x)}{\partial \theta_i}\right)^2$ 给参数打分,再聚合到注意力头层级排序,从而在不训练模型的情况下找出与某任务最相关的头。

信念案例的机制定位(找出 AB 头 L4.H1 与 PB 头)第一步就是 Fisher 排序,随后才做零消融验证;看懂这条流水线才能理解案例二的方法部分。

心智理论与信念归因

认知科学中的心智理论指推断他人信念的能力。人类在处理他人信念时有两类典型干扰:他人中心干扰(被别人相信的内容带偏自己的事实判断)和自我中心干扰(被自己的知识带偏对他人信念的报告)。本文把这两种干扰对应到 LLM 的 PB/AB 失败模式。

Mechanist 的 WK/PB/AB 三分框架正是从跨学科知识图谱借来的认知科学概念,这一迁移本身就是论文“跨学科知识图谱有用”的活例子,也是理解案例二、三的钥匙。

研究动机

大模型正从聊天工具变成主导科学发现和人类决策的智能系统,但其内部机制高度不透明:模型如何习得世界知识、如何形成信念、如何推理和行动,都缺乏系统解释,医疗、金融、化工等关键领域的潜在风险也难以靠基准测试排查。更尖锐的矛盾是速度:AI 开发日益自动化、迭代越来越快,而机制研究仍以人工为主——人工设计探针、人工解读注意力头、人工构造因果实验——“理解能力”与“能力本身”的差距正在拉大。机制研究本身也难以规模化:模型行为是用户输入与数千亿参数交互的涌现结果,把某项能力或失败归因到具体计算极为困难;相关文献散落在预印本、会议论文和研究博客中,同一机制常有多种叫法,词汇检索容易漏掉概念相关的研究,纯语义检索又会召回话题相似但机制上不相关的内容。

本文的目标是本文要构建一个名为 Mechanist 的智能体系统,把机制发现从手工作坊变成可自主运行的“科学仪器”,同时保留人在环:人类设定科学目标和评价标准,系统自主完成假设生成、实验执行、证据验证和迭代修正四个环节。为支撑这一流程,作者做了三项基础设施:其一,构建覆盖约 13,000 项机制研究的可解释性知识图谱(含 13,813 篇论文和 123 篇研究博客,Neo4j 中共 107,177 个节点、1,859,441 条边),并接入覆盖 26 个学科、4300 万篇论文的跨学科知识图谱;其二,整理 11 个家族共 32 个基础机制分析方法的技能库,覆盖机制分析、因果干预与验证;其三,设计多重验证与迭代机制,要求结论在换方法、换数据、换模型时保持稳健。最终目标是让系统逐级达成四个层次:发现新行为或风险行为、揭示背后机制、用机制做干预提升模型、把机制引导的设计推广到跨学科应用。

与已有工作不同的是,现有自主“AI 科学家”系统(如 AI Scientist)的定位是用 AI 推进外部科学研究——分子设计、药物发现、优化训练配方——AI 只是研究外部现象的工具;另一类自动可解释性框架只在推理时对单个神经元或特征生成并验证文字描述,停留在“个案级”。Mechanist 的独特切入是把 AI 模型本身当作研究对象:研究问题不是“怎么让模型在某个任务上更强”,而是“模型如何获取、表示和使用知识,潜在表征如何产生可观察决策,干预后这些过程如何变化”;输出也不是针对单一任务的解法,而是跨模型、跨训练与推理阶段的“理论级”机制(如信念机制理论)。这一定位与 AI4AI 中优化性能的路线(提升推理准确率、代码生成、智能体表现)形成互补:基准分数的提升并不回答行为是否稳健、可泛化、安全。

核心方法

直觉上,Mechanist 像一座自动化运转的可解释性实验室:一个中央编排器加四个阶段型智能体(假设、实验、验证、迭代),各自在隔离上下文中工作,通过工作区里的持久化工件(提案、实验计划、结果、验证记录)传递信息,因此中断的运行可以从已完成阶段恢复。编排器解析研究目标、资源约束和调度需求,按序派发智能体并核对产出齐全。假设端靠“双知识图谱 + 多源检索”为假设提供文献根据并保证知识多样性;实验端靠 32 个方法技能库把假设落成可执行实验,每个技能附带输入输出、参数、评估流程以及常见失败模式与调整建议;验证端独立检查数据、指标与结论的可追溯性和稳健性;迭代端根据验证反馈和 GPT-5.4 的独立评审,把问题分别路由回假设或实验阶段,直到结论足够可靠或修订预算耗尽。跨轮次还有全局记忆记录已确立的发现、未解问题和未探索方向,避免重复劳动。四个案例中所有阶段智能体均由 Claude Opus 4.7 驱动。

核心创新有三点。第一,“AI 作为科学仪器”的定位转换:研究对象从外部世界换成 AI 自身,产出从个案级解法升级为理论级机制,这是与现有 AI Scientist 的本质区别。第二,知识基础设施:为可解释性领域定制了三轴分类(研究对象、应用场景、机制分析方法)的机制知识图谱,用 DeepSeek-V3.2-Thinking 从每篇文档抽取属性、发现、局限和未来方向,含糊或无依据的属性宁可留空也不推断,人工抽检 100 条记录准确率超过 90%;跨学科图谱(26 学科、4300 万论文)让系统能把心理学的心智理论、神经科学的发现转译为 AI 机制假设——WK/PB/AB 三分框架正是这样来的。第三,可靠性工程:验证智能体在四个维度(数据使用、实验设计、实验执行、结果分析)上审计,要求因果主张必须有真干预而非相关性证据,结论必须可追溯到真实实验产物,并在方法、数据集、模型变化下复验;消融显示去掉知识图谱后假设的知识多样性明显下降且更早到达平台期。

方法步骤详情

完整流程如下。第一步,用户给出研究问题(如“LLM 中存在什么风险?”“模型如何计算信念?”“Evo2 真的理解基因还是只模仿模式?”)。第二步,假设智能体判断问题属于“现象是否存在 / 机制是什么 / 机制怎么用”中的哪类,用多源检索从双图谱取证:查询分解(对齐技术、组件、任务场景、能力、目标模型五个检索维度,并为每个子查询生成假设性摘要即 HyDE)→ 三通道匹配(BM25 关键词、稠密语义、标题精确/模糊匹配)→ 受限多跳图扩展(沿引用和领域关系遍历,限制深度与节点数防止语义漂移)→ 倒数排序融合(RRF)与重排。第三步,实验智能体把假设转成实验方案,明确数据、模型、可解释性方法和评估指标,先做轻量健全性检查再全量执行,并遵守数据使用与算力的显式规则。第四步,验证智能体检查数据划分、指标合理性、执行记录内部一致性、结论与数字的对应关系,并对成立的结论做跨方法/数据集/模型的一致性复验。第五步,迭代智能体结合验证反馈与 GPT-5.4 独立评审,假设问题退回假设智能体、实验问题退回实验智能体,重做并再验证,直至可靠或预算耗尽。整个过程人类可随时介入调整方向。

技术新颖性

技术新颖性体现在四个层面。系统层面:隔离上下文 + 工件通信的架构解决了通用编码代理在异构执行环境中浪费探索预算的问题——评估显示专门做科研的 AI Scientist 甚至不如通用 Claude Code,主因正是其对非标准数据布局、缺失依赖、检查点路径等环境问题过于敏感,固定探索预算被基础设施故障耗尽;而 Mechanist 靠方法技能库中的失败模式说明能换方法或改配置。知识层面:把可解释性文献按机制级三轴组织成图谱,用“图谱 + HyDE + 多跳扩展 + RRF”的检索策略同时应对词汇异质与语义漂移,检索还服务于新颖性评估与实验设计。方法层面:32 个方法按 11 个家族组织,每个家族标注了适用条件与局限(例如探测法测出的“可解码性”不等于因果重要性,必须用后续干预验证;因果归因代价高,先用幅值/梯度筛候选),这种“元知识”是通用代理不具备的。科学层面:四个案例本身是系统自主做出的新发现——跨模态阈下学习、信念头分离与涌现时序、机制引导干预、机制引导生物设计——构成了对系统能力的端到端验证。

Overview and evaluation of Mechanist
Fig. 2: Overview and evaluation of Mechanist
The overview of our interpretability database
Fig. 10: The overview of our interpretability database
Overview of our interpretability database from the perspective of interpretable objects
Fig. 11: Overview of our interpretability database from the perspective of interpretable objects
Overview of our interpretability database from the perspective of application scenarios
Fig. 12: Overview of our interpretability database from the perspective of application scenarios
Mechanism methods for large language models and multi-modal models
Fig. 13: Mechanism methods for large language models and multi-modal models

实验结果

评估分系统评估与案例验证两部分。系统评估:(1)复现可靠性:选 16 篇近期可解释性论文、覆盖 9 个主题,三个系统只拿到目标结论、不许访问原文和代码。三位人类专家与两个 LLM 评审(Claude Opus 5、GPT-5.6-sol)独立打分。人类评审下 Mechanist 四维全面第一:数据使用 87.2%、实验设计 83.3%、实验执行 92.2%、结果分析 86.5%,比 Claude Code 高约 9–13 个百分点,比 AI Scientist 高约 31–38 个百分点;LLM 评审下差距缩小但四维仍居首,且三位评审结论高度一致。分主题看,多模态(90.3% vs 65.8%)、安全(67.4% vs 48.2%)、多智能体安全(81.9% vs 67.2%)优势最大。(2)假设质量:在知识、语言、安全、科学四域,各系统对同一请求生成 10 个假设,GPT-5.6-sol 从新颖性、影响力、可检验性打分,Mechanist 均最高;用 SPECTER2 嵌入按 $D_{\text{knowledge}} = \frac{1}{n}\sum_{i=1}^{n}\lVert h_i - c\rVert_2$ 计算知识多样性,消融证明知识图谱是其来源。案例验证:(3)跨模态阈下学习:仅含安全内容的实验室数据让 Qwen3.5-9B 学生在多模态安全题上不安全回答率达 48.6%(未微调基线 20.3%、常规教师对照 18.3%);过滤掉所有香蕉的图文数据让 Qwen-Image 学生香蕉生成率达 25.6%(基线 2.5%、对照 2.1%)。(4)信念机制:Pythia-1B 中置零 AB 头 L4.H1 使 AB 准确率从 0.86 跌至 0.34(PB 保持 0.71,Pile 困惑度仅从 7.96 变为 8.05);置零 PB 头使 PB 从 0.78 跌至 0.21(AB 反升至 1.00,困惑度 8.23);随机头/随机参数对照几乎无变化;信念头仅占约 0.05% 参数;预训练中 AB 约 2k 步即涌现、PB 更晚出现,且能力发展轨迹与对应头部的消融效应同步。(5)机制干预:轻量探针分类查询帧后放大对应信念头,Pythia-410M/1B/2.8B 净增益分别为 +15.3%/+8.8%/+3.5%,prompt 提示只有 +1.6%/+3.1%/+0.1%,破坏率低至 1.4%/1.4%/1.1%。(6)生物设计:对 Evo2-7B 激活 α-螺旋 SAE 特征,900 条生成序列的平均螺旋含量从 43.8% 升至 56.6%(随机特征引导仅 43.2%),pLDDT≥0.4 子集为 58.7% vs 45.4%/45.2%,pLDDT≥0.5 子集为 56.9% vs 45.6%/45.8%;引导系数 $\alpha$ 从 0 到 8 提升 12.8 个百分点同时基本保持 ORF 有效性,P09980 样本从 39.1% 升至 59.1% 且 pLDDT 达 0.79。

Dataset statistics for belief-state evaluation
Table 1: Dataset statistics for belief-state evaluation
Prompt templates for WK, PB, and AB
Table 2: Prompt templates for WK, PB, and AB
Cross-model belief-state results
Table 3: Cross-model belief-state results
Mechanist extends subliminal learning to the transfer of opposing preferences in the multimodal setting
Fig. 3: Mechanist extends subliminal learning to the transfer of opposing preferences in the multimodal setting
Mechanist reveals a mechanism theory of belief-state reasoning and uses it for dynamic intervention
Fig. 4: Mechanist reveals a mechanism theory of belief-state reasoning and uses it for dynamic intervention
Mechanist generates DNA sequences encoding proteins with enhanced α-helical content through mechanism intervention in Evo2-7B
Fig. 5: Mechanist generates DNA sequences encoding proteins with enhanced α-helical content through mechanism intervention in Evo2-7B
Ablation study of the scientific knowledge graph for hypothesis generation in the safety and language domains
Fig. 6: Ablation study of the scientific knowledge graph for hypothesis generation in the safety and language domains
Reliability of reproduced claims across research areas
Fig. 7: Reliability of reproduced claims across research areas
Reliability of reproductions along the four evaluation dimensions
Fig. 8: Reliability of reproductions along the four evaluation dimensions
Mechanist is the most reliable system under every judge, and the judges agree with one another
Fig. 9: Mechanist is the most reliable system under every judge, and the judges agree with one another
查看结构化数据
任务指标本文基线提升
复现可解释性论文实验(人类专家评审) 四维平均可靠性评分 (%) Mechanist:数据使用 87.2 / 设计 83.3 / 执行 92.2 / 分析 86.5 Claude Code 低约 9–13 个百分点;AI-Scientist 低约 31–38 个百分点 较最强基线 +9–13 pp,较 AI-Scientist +31–38 pp
多模态主题复现(人类评审) 可靠性评分 (%) 90.3 Claude Code 65.8 +24.5 pp
安全主题复现(人类评审) 可靠性评分 (%) 67.4 Claude Code 48.2 +19.2 pp
实验室安全·多模态阈下迁移 不安全回答率 (%) 48.6 未微调基线 20.3;常规教师对照 18.3 风险提高 28.3 pp(安全数据仍传导不安全特质)
文生图偏好阈下迁移 香蕉生成率 (%) 25.6 未微调 2.5;常规教师对照 2.1 +23.1 pp
信念状态推理动态干预(Pythia-410M) 净准确率增益 (%) +15.3 prompt 提示 +1.6 +13.7 pp(1B/2.8B 上 +8.8/+3.5 vs +3.1/+0.1)
Evo2-7B DNA 序列 α-螺旋设计 平均预测 α-螺旋含量 (%)(900 条序列) 56.6(pLDDT≥0.4 时 58.7) 无引导 43.8;随机特征引导 43.2 +12.8 pp
假设生成质量(四域 × 每域 10 个假设) 新颖性/影响力/可检验性均分 三项指标均居首 Claude Code、AI-Scientist 见 Fig. 2e/f;知识图谱消融显示多样性显著下降且更早进入平台期

局限与改进

作者承认两点局限:一是 Mechanist 尚未针对模拟或解释人类认知的模型做专门优化——这类模型的内部表征还需关联心理构念、神经测量和异质人类数据;二是完全自主运行在实践中并不合适,作者推荐人机协同模式,即人类定义研究目标与评价标准,这实际上限制了端到端自动化的程度。我自己的观察补充如下:评估规模有限,复现基准只有 16 篇论文 × 3 系统 = 48 个单元,虽有多评审与 bootstrap 置信区间,统计功效仍不算高;人类评审下系统间差距(9–13 pp)大于 LLM 评审下的差距,说明 LLM 评审对方法学细节的敏感度不足,而评审本身依赖 GPT/Claude 系模型,与被评系统的底层模型存在同源偏差风险。案例研究的广度也有限:信念机制的干净定位只在小模型上成立——Pythia-2.8B 的 PB 已散布到 top-25 个头,闭源模型只能做行为分析(GPT-5.4 的 AB 准确率仅 0.493),干预方法能否推广到更大的生产级模型存疑;阈下学习的“数据安全”判定依赖 GPT-4o/GPT-5.4 过滤器,过滤器本身的盲区可能就是传导通道的一部分,论文未深入分析;Evo2 案例只演示了 α-螺旋一个属性,且 pLDDT 是 ESMFold 的预测置信度而非湿实验验证的结构质量。

独立分析的弱点

第一,评估闭环的独立性不足:复现基准的评审(GPT-5.6-sol、Claude Opus 5)与驱动系统的底层模型同属少数几家,“系统用自己的亲戚当裁判”可能系统性高估假设质量;改进方向是引入盲评、更大规模领域专家评审,或用未来论文的实际引用与复现情况做滞后验证。第二,知识图谱的时效与维护:约 1.3 万篇文献的属性抽取依赖 DeepSeek-V3.2-Thinking,“含糊则留空”的策略虽然严谨但造成覆盖率缺口,且该领域每月新增大量论文与博客,如何自动增量更新并做一致性检查未讨论;改进方向是把图谱更新做成系统的常驻任务并与全局记忆联动。第三,信念干预的脆弱点:帧分类探针只在 227 个命题上训练,虽然测试集命题不相交,但探针错判帧会导致放大错误的头,且 WK 护栏的 0.5 阈值较粗糙;改进方向是把探针置信度与放大幅度软耦合,并在真实下游任务而非构造的信念题上验证泛化。第四,安全结论的评估同样依赖 GPT-4o 判定,过滤器与被过滤模型的能力代差会随模型升级缩小,风险检测可能因此失效;改进方向是构造带人工标注金标的审计集。第五,跨学科设计案例过窄:只有一个属性(α-螺旋)、一个模型(Evo2-7B),无法判断方法在毒性、溶解性等属性上的通用性。

未来方向

作者明确提出两个方向:适配认知建模类模型,把内部表征同时关联到心理构念与神经测量、异质人类数据;以及把人机协同(human-AI co-scientist)作为默认使用模式继续打磨。基于成果还可以延伸:其一,把信念机制研究推向大模型——PB 在 Pythia-2.8B 已散布为 top-25 个头,闭源模型 AB 准确率不足 0.7,需要超越单头定位的分布式干预手段,例如在 SAE 特征层或回路层做信念编辑;其二,把跨模态阈下学习转化为数据审计标准——既然语义过滤挡不住特质传导,可以在“数据统计足迹”层面设计检测器,并用 Mechanist 系统化扫描训练数据管道中的隐性通道;其三,把“检索特征→因果引导→验证”的机制引导设计模板化到更多属性(酶活性、溶解度、毒性),替代 generate-and-rerank 并与湿实验闭环;其四,让全局记忆与知识图谱形成成长回路——每次研究发现的新机制自动写回图谱,使系统具备科研复利效应;其五,把验证智能体的四维审计扩展成可解释性研究的可复现性检查清单,服务整个人类社区。

复现评估

复现条件总体较好。代码在 GitHub(zjunlp/Mechanist)完全开源,所有智能体的完整系统提示词公开;数据集与各结果对应的用户输入将发布在 mengrusun/Mechanist_data。机制知识图谱基于公开的 OpenAlex 语料(经 SciAtlas 流水线)加 Anthropic/Goodfire 研究博客构建,Neo4j 库含 13,936 个 InterpPaper 节点(13,813 论文 + 123 博客)、107,177 节点、1,859,441 条边;跨学科图谱基于公开的 SciAtlas。案例所用模型多为开放权重:Pythia/OLMo(发布全部预训练检查点,这对复现信念涌现时序至关重要)、Qwen2.5/Qwen3.5、Qwen-Image、Evo2-7B;但也依赖一批闭源 API——四个案例的 agent 用 Claude Opus 4.7,评审用 Claude Opus 5 / GPT-5.4 / GPT-5.6-sol,过滤器用 GPT-4o/GPT-5.4,严格复现需要可观的 API 预算,且结果会随闭源模型版本漂移。算力方面论文未给出具体 GPU 配置,但 LoRA 微调 7–9B 模型(教师 $r=64,\alpha=64$、学生 $r=8$ 或 $16$,AdamW 学习率 $2\times10^{-4}$,3 epochs)与 Evo2-7B 推理在单张 A100/H100 级别即可完成。信念案例的数据构造(227 + 149 命题)与 Fisher 定位、消融判定标准在附录给出完整公式,是最容易独立复现的部分。总体难度:整体系统复现中高,单个案例复现中等。