跳转到内容
← 返回研究前沿
人工智能2020s14 分钟阅读

机制可解释性:从可命名特征到因果机制

Mechanistic Interpretability from Named Features to Causal Mechanisms

2021 年,OpenAI 研究者在 CLIP 中观察到一个“蜘蛛侠神经元”:蜘蛛图像、单词 spider 的图像和蜘蛛侠角色都会激活它。这说明模型内部可能出现跨文字、符号和视觉形式的抽象响应。 但一个容易理解的神经元不是完整解释。它可能只在特定数据上相关,可能与其他方向共同编码概念,也可能不是产生最终输出所必需的计算…

可解释性机制可解释性稀疏自编码器因果干预AI安全

2021 年,OpenAI 研究者在 CLIP 中观察到一个“蜘蛛侠神经元”:蜘蛛图像、单词 spider 的图像和蜘蛛侠角色都会激活它。这说明模型内部可能出现跨文字、符号和视觉形式的抽象响应。

但一个容易理解的神经元不是完整解释。它可能只在特定数据上相关,可能与其他方向共同编码概念,也可能不是产生最终输出所必需的计算步骤。

机制可解释性试图从模型参数和激活中提出关于内部计算的可检验假设。它比生成一段自然语言理由要求更高,却远未达到“像读源代码一样理解每个权重”。

先问要解释什么、为谁解释

“让模型可解释”不是一个完整目标。研究需要指定:

  • 对象:单次预测、某类行为、一个能力,还是全局算法;
  • 读者:模型研究者、部署工程师、审计员或受影响用户;
  • 用途:调试、科学理解、安全监测、合规说明还是申诉;
  • 粒度:输入特征、神经元、表示方向、注意力头、电路或训练过程;
  • 反事实:改变哪个内部量,预期哪个输出怎样变化。

同一方法不必满足所有用途。SHAP 可以描述输入特征对局部预测的归因,却不解释 Transformer 如何实现算法;机制电路可能帮助研究者调试,却不一定给贷款申请者提供可行动的理由。

四层不同证据

行为描述

用输入输出测试发现模型在什么条件下成功或失败。它最接近软件测试,能界定能力,却不能唯一确定内部机制。

表征解码

线性探针或分类器能从隐藏状态读取某个变量。这只说明信息可被提取,不说明模型实际使用了它。高维表示常包含许多可解码信息。

局部归因

梯度、遮蔽、激活 patching 或 attribution tracing 估计哪些组件对某次输出重要。归因依赖基线、替换分布与局部线性近似,不自动给出全局算法。

因果机制

研究提出组件、信息流和算法假设,再干预内部状态,预测模型行为如何改变。更强证据还要求保留必要组件时行为基本不变、移除关键组件时能力按预测下降,并能推广到留出输入。

从“相关激活”到“因果机制”需要逐层升级,不能因为特征有一个好名字就跳过中间检验。

多义性、叠加与基底问题

多义性(polysemanticity)指一个神经元在数据中响应多个看似不同的概念。按神经元逐一命名因此容易失败。

叠加(superposition)是假说:当有用特征数量超过表示维度,且特征只稀疏出现时,模型可以用非正交方向编码更多特征。Anthropic 的《Toy Models of Superposition》在受控小模型中展示了这种几何现象。

从玩具模型到大型语言模型仍有距离。真实模型中的表示可能非线性、上下文依赖且分布式;同一个行为也可能由多条冗余路径实现。

还有一个基底不唯一问题:隐藏空间可以在保持模型功能的情况下重新参数化。人类喜欢的“一个方向一个概念”不是由网络函数自动指定的唯一坐标系。解释方法必须说明为什么选择的分解比其他同样可重建的分解更有科学意义。

稀疏自编码器做了什么

稀疏自编码器(SAE)用一个过完备字典近似模型激活 \(h\):

\[ h \approx W_d z + b,\qquad z=\operatorname{SparseEncode}(h) \]

潜变量 \(z\) 的维度可以远大于原神经元数,但每次只允许少数特征活跃。训练在重建误差与稀疏性之间权衡。

2023 年《Towards Monosemanticity》在单层 Transformer 上提取出比神经元更容易命名的特征。2024 年《Scaling Monosemanticity》把 SAE 扩展到 Claude 3 Sonnet,并展示与金门大桥、代码错误、欺骗语境等相关的特征。

这些结果支持“可从大型模型激活中提取一些可解释方向”,不支持以下更强结论:

  • 字典覆盖了模型全部计算;
  • 每个特征对应一个自然种类;
  • 激活某个“欺骗特征”等于模型正在现实中欺骗;
  • SAE 特征是模型自身使用的唯一计算单位。

重建质量与可解释性还存在权衡。字典太小会合并概念,太大会把一个概念切成许多上下文碎片;自动命名器也会把高激活样本中的表面共同点误作特征本义。

特征必须能复现

2026 年 ACL 论文指出,同一激活数据上重新训练 SAE,得到的字典可能不一致。这会妨碍模型比较:一次运行中的“安全特征”未必在另一次运行中以相同方向出现。

该研究建议在重建误差和稀疏度之外报告跨运行特征一致性,并用匹配后的字典相关衡量稳定程度。它没有证明存在唯一规范字典,而是把“重跑能否找回相近特征”变成独立评价轴。

稳定也不等于忠实。一个方法可以稳定地提取与数据相关但不参与模型计算的方向。

从特征走向电路

电路是假定共同实现某个行为的一组组件和连接。归纳头是经典案例:某些注意力头能利用前文重复模式帮助预测后续 token。

电路研究通常组合:

  1. 找到与任务表现相关的组件;
  2. 用激活替换或消融测试必要性;
  3. 检查保留电路能否重现原行为;
  4. 在新输入和相邻任务上检验预测;
  5. 比较竞争电路与更简单基线。

仅把注意力边画出来不够。注意力权重表示信息路由的一部分,不直接说明值向量携带什么,也不说明后续层怎样使用它。

2025 年属性图:进展与“暗物质”

Anthropic 在 2025 年用跨层转码器和属性图分析 Claude 3.5 Haiku 的若干具体输出,展示了押韵规划、算术和不忠实推理等候选机制。

研究团队同时明确限制:

  • 属性图来自替代模型,只能提出关于原模型的机制假设;
  • 方法一次主要解释一个输出 token;
  • 长提示和长推理链会累积重建误差;
  • 图中存在无法解释的误差节点,即计算“暗物质”;
  • 图被大幅剪枝,并依赖人工组合特征;
  • 某些干预结果与属性图预测不一致。

因此,“追踪到一条路径”不等于完整解释。未显示路径可能仍然重要,多条平行机制也可能在不同输入上接管行为。

基准开始改变结论

过去研究常用少量漂亮案例证明方法有效,方法之间难以比较。2025 年 MIB 基准把评价拆成电路定位和因果变量定位,并使用具有已知结构或可评分目标的任务。

在该基准中,归因和掩码优化方法在电路定位上表现较好;监督式 Distributed Alignment Search 在因果变量定位上最好,而 SAE 特征没有优于原始神经元表示。

这个结果不证明 SAE 无用。它说明“特征容易命名”和“在指定任务中恢复真实因果变量”是不同指标,研究不能只展示挑选后的语义案例。

2026 年“全局工作空间”研究

2026 年 7 月,Anthropic 报告在 Claude 中找到一个低维、可影响后续语言表达的内部空间,并称之为 J-space。研究者用读取与交换干预展示,某些表示可影响模型在不同任务中明确说出或使用一个概念;他们还用该工具检查评测意识与经过训练的破坏目标。

“全局工作空间”是对功能结构的类比,不是模型具有意识的证据。结果来自特定 Claude 版本、构造任务和实验室工具;标签由研究者解释,监测器也可能有盲区。真正的安全价值需要在未见模型、自然任务和对抗适应下验证误报、漏报与可规避性。

怎样评价一个机制解释

维度核心问题常见检验
忠实性解释是否追踪原模型真实计算内部干预、替代模型误差
完备性是否覆盖产生行为的重要路径保留/删除测试、误差节点占比
稳定性换输入、种子、字典后是否保持留出集、跨运行特征匹配
特异性干预是否只影响目标行为邻近任务与副作用测量
简洁性是否比原模型更容易理解电路规模、人工审查时间
预测力能否预言新条件下的行为变化预注册干预与外部验证
人类效用目标读者是否能做出更好判断盲法用户研究、错误检测率

评价应包含负对照和简单基线。随机方向、神经元、监督探针或只看输入输出,有时能取得相近结果;没有比较,就无法知道复杂解释方法增加了什么。

可解释性不是安全证明

即使准确识别一个危险特征,也还需要回答:

  • 该特征在所有表达方式下都会出现吗;
  • 模型能否把同一目标迁移到未监测方向;
  • 干预会不会只压制可见信号而保留行为;
  • 监测器是否在分布外和攻击条件下稳定;
  • 人类审计员能否在有限时间内正确理解结果。

机制可解释性可以成为安全案例的一层证据,但不能替代红队测试、能力评估、访问控制、运行监测和事件响应。证明一个局部电路也不等于证明整个模型满足政策。

如何阅读一项可解释性研究

先问研究解释的是一次输出、一个任务还是整个模型。案例级结论不能写成全局机制。

再看解释单位怎样得到:神经元、探针、SAE 特征或替代模型分别引入不同假设。

检查是否有内部干预、留出输入、负对照和简单基线;只展示高激活文本与自然语言标签,证据仍停留在相关层。

最后看未解释计算、失败案例和跨运行稳定性是否报告。解释图越漂亮,越要确认剪枝、人工选择和重建误差隐藏了什么。

跨域连接

  • 神经元:两边共有同一道分界:能从活动中解码出某个变量,不等于系统真的用了它。区别在证据强度——人工网络可以精确复制、任意干预、反复重跑,生物系统做不到。所以人工网络里"因果机制"这个词该被要求得更严,而不是更松。
  • 大语言模型:解释只对一个具体检查点成立。换版本、换提示、换训练数据,内部表示都会变,因此"某模型有某特征"这句话必须绑定权重快照才有意义。这也解释了为何这类结论难以复用:被解释的对象本身在不断替换。
  • 可重复性危机:同一批激活重训一次字典,得到的特征可能对不上。稳定性由此成为独立的评价轴,而不是重建误差的副产品;但要立刻补一句:稳定也不等于忠实——一个方法完全可以稳定地提取出与数据相关、却不参与模型计算的方向。
  • 科学哲学:相关、干预、机制是三个不同层次的证据,任何一张漂亮的可视化都跨不过去。已经站得住的是"能从激活里提出一些可命名方向";仍属推测的是叠加假说、以及字典覆盖了模型的全部计算。剪枝、人工挑选与重建误差藏起了什么,必须一并报告。
  • 形式化方法与验证:两者给出的保证类型不同。形式验证在一个明确模型内证明性质成立,可解释性给的是经验性的机制假说,不构成安全证明:识别出一个危险特征,并不排除同一目标经由未监测方向表达,也不排除干预只压住了可见信号。

参考文献

  1. Goh, G., et al. (2021). Multimodal Neurons in Artificial Neural Networks. Distill. DOI: 10.23915/distill.00030.
  2. Elhage, N., et al. (2022). Toy Models of Superposition. Transformer Circuits Thread.
  3. Bricken, T., et al. (2023). Towards Monosemanticity: Decomposing Language Models With Dictionary Learning. Transformer Circuits Thread.
  4. Templeton, A., et al. (2024). Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet. Transformer Circuits Thread.
  5. Lindsey, J., et al. (2025). On the Biology of a Large Language Model. Transformer Circuits Thread.
  6. Mueller, A., et al. (2025). MIB: A Mechanistic Interpretability Benchmark. Proceedings of ICML 2025, 45069-45108.
  7. Song, X., et al. (2026). Mechanistic Interpretability Should Prioritize Feature Consistency in Sparse Autoencoders. Proceedings of ACL 2026, 2172-2210. DOI: 10.18653/v1/2026.acl-long.99.
  8. Anthropic Interpretability Team. (2026). A Global Workspace in Language Models. Anthropic Research, July 6, 2026.

延伸阅读

  1. Olah, C., et al. (2020). Zoom In: An Introduction to Circuits. Distill. DOI: 10.23915/distill.00024.001.
  2. Dasgupta, S., Frost, N., & Moshkovitz, M. (2022). Framework for Evaluating Faithfulness of Local Explanations. ICML, 4794-4815.
  3. Nanda, N., et al. (2023). Progress Measures for Grokking via Mechanistic Interpretability. ICLR 2023.