跳转至

条条电路通罗马:大模型可解释性的「唯一机制」可能从一开始就不存在

Ch01.469 条条电路通罗马:大模型可解释性的「唯一机制」可能从一开始就不存在

📊 Level ⭐⭐ | 14.3KB | entities/条条电路通罗马大模型可解释性的唯一机制可能从一开始就不存在.md

条条电路通罗马:大模型可解释性的「唯一机制」可能从一开始就不存在

来源: 机器之心 发布日期: 2026-06-30

会议: ICML 2026(韩国,首尔)

论文: https://openreview.net/forum?id=3uC9teMlUt

代码: https://github.com/TonyXiChen/OASR

ICML 2026 收录论文系统性地推翻了机制可解释性领域一个长期默认的前提:模型的每个能力背后存在唯一的核心内部电路。通过"重叠感知的 sheaf 排斥"(OASR)方法,作者证明同一个任务可由多条结构几乎完全不重叠的电路独立完成——"条条电路通罗马"。

摘要

长期以来,机制可解释性(Mechanistic Interpretability)领域有一个几乎从未被明说、却被视为理所当然的前提:模型对于同一种任务的能力或表现,背后对应着一条唯一的、或近乎唯一的内部"电路"。但一篇被 ICML 2026 接收的论文给出了一个让人不太舒服的答案:"唯一电路"可能从一开始就不存在

同一个任务,可以由许多结构上几乎完全不重叠、却有着同样高任务能力、稀疏、完备的电路独立完成。论文把这个被长期默认的前提命名为"功能各向异性假说"(Functional Anisotropy Hypothesis),并从实验与理论两种路径系统性地推翻了它。

核心要点

  • 论文提出 OASR(Overlap-Aware Sheaf Repulsion)方法,在 DiscoGP 基础上增加重叠惩罚,迫使优化器寻找结构上不同但功能等价的 sheaf
  • 在 IOI 任务上,OASR 发现的两条 sheaf 交并比仅为 4.1%,逼近在 DAG 限制下随机选边的重合度——但两者都达到 100% 准确率
  • 发现"三条边核心"看似不可或缺,但将 IOI 拆解为 ABBA 与 BABA 子模板后,"三条边全部禁用"的约束下模型仍能找到高度可用的电路
  • 理论贡献:分布式稠密电路假说(Distributive Dense Circuit Hypothesis)——电路解释的非唯一性是高维表示中叠加(superposition)的必然结果
  • 跨越 ACDC、EAP、EP 四种主流方法,同样的非唯一性现象在每种方法上复现——功能各向异性的失效是普遍现象,不是某一方法的偏差

背景:功能各向异性假说

论文将 CSD(Circuit and Sheaf Discovery)领域长期以来默认的假设形式化命名为功能各向异性假说。该假说认为:在一个神经网络的参数空间中,每个任务或能力对应着一个在结构上被特化的、唯一的内部机制(电路或 sheaf)。

这一假说主导了整个领域的评测范式: - 基于 Tracr 的合成基准用"发现的 circuit 与预设的 ground-truth 机制有多吻合"来打分 - MIB(Mechanistic Interpretability Benchmark)奖励那些用最少组件达到高性能的 circuit - 两者都隐式默认"同一模型内,一个任务对应一个机制解释上的正确答案",并默认压缩终将收敛到一个唯一核心机理

OASR 方法

核心思路

OASR 建立在 DiscoGP 框架之上。DiscoGP 把 sheaf 发现通过 Gumbel-Sigmoid 建模为一个可微的"选边"问题:给每条边一个可学习的 logit,在稀疏、任务性能、完备三个目标下通过 STE 优化一个二值掩码。

OASR 在此之上只加了一项重叠惩罚:每发现一个 sheaf,就把已经被保留的那些边"记下来",并在后续发现过程中惩罚它们再次被保留。具体而言,在原有的任务性能 + 连接稀疏 + 功能完备目标之外,额外加上一项重叠损失,对"已被先前 sheaf 选中的边的并集"的激活施加惩罚。这一项在多次 sheaf 发现之间制造排斥力,迫使优化器去寻找有同样任务能力、稀疏、完备,却与之前结构尽可能不同的替代方案。

关键实验发现

在 IOI(间接宾语识别)任务上,OASR 找到的两条 sheaf(A 和 B):

  • 两者都在 IOI 上达到 100% 准确率
  • 交集仅 96 条边,并集 2351 条边
  • 交并比(IoU)仅为 4.1%——逼近在 DAG 子图限制下随机选边的重合度

作者进一步排除了"只是表面差异"的可能:逐层分析两条 sheaf 的边分布有显著不同,不是简单的重参数化或组件的换位,而是信息流动与选取方式在层间的真正不同。而且,这个现象不止 IOI 一个任务——在 BLiMP 的子任务(AGA、ANA、DNA 变体、Docstring 等)上都能稳定地找到两个任务性能相当但 IoU 极低(普遍在 4%-11% 之间)的 sheaf。

深度分析

核心现象:更多的电路不会导向一个共识

论文最重要的实证发现是:随着 OASR 发现的 sheaf 数量增加(从 2 条到 20 条),并集稳步增长,交集却持续萎缩。在许多任务上,20 条 sheaf 的全局交集最后只剩几十条边,互 IoU 远低于 1%(IOI 在 OASR 下仅为 0.15%)。显式地施加 OASR 重叠惩罚,会让这个共享交集进一步缩小,同时几乎不损失稀疏性和性能。

这意味着:增加发现的 sheaf 数量,并不会让它们收敛到一个共同的核心。更多的 sheaf,不会通向一个共识,它们只是揭示了更多互不相同、却同样可行的实现机制。

作者特别强调,这种"消失的交集"不能用随机初始化的噪声或发现过程的不稳定来解释——在所有运行都产出高质量 sheaf 的前提下,交集结构依然极小,并在显式惩罚重叠时进一步收缩。

跨方法验证:不是某一方法的偏差

一个自然的质疑是:会不会这只是 DiscoGP + OASR 这一种方法的特性?作者将同样的分析搬到了另外三种主流方法上:

方法 设计哲学 非唯一性证据
ACDC 阈值驱动的逐边删除 注意力头遍历顺序敏感:改变同一层头索引顺序,给出结构差异巨大的不同电路
EAP 一阶梯度归因 任务无关信息敏感:将 John/Mary 换成 Alice/Bob(完全等价任务),IoU 随保留边数系统下降
EP 梯度优化的边剪枝 将 KL 散度目标换成任务特定损失后,同样表现出高度不一致性

跨越这些方法论巨大差异,结论是一致的:功能各向异性的失效是贯穿主流 circuit 与 sheaf 发现范式的普遍现象。

"三条边核心"的消失与任务分解

论文中最令人印象深刻的实验是"三条边故事"。从多条 OASR 发现的 IOI 电路中反复取交集,缩到 11 条边时仍能保持 90% 以上准确率。从这 11 条边出发穷举搜索,最终分离出一个超稀疏的三条边 sheaf——在 zero ablation 条件下,仅靠这三条边,IOI 准确率达到 86.7%。乍一看,这三条边简直就是"不可或缺的核心":从已发现的 IOI 电路中移除它们,平均准确率从高位跌到 52.3%;在发现过程中禁用它们,DiscoGP 甚至无法找到达成高任务性能的 sheaf。

然而,这个结论建立在被忽视的前提上:把 IOI 当成一个不可分割的整体任务。当作者把 IOI 拆解成 ABBA 与 BABA 两个子模板,并在"三条边全部禁用"的约束下重新做 sheaf 发现时,模型依然能找到稀疏(边密度低于 3.5%)、高度可用的电路。于是论文确立了"非不可或缺性":每一条边都能被某条替代 sheaf 绕开。那个看似坚不可摧的三条边核心之所以显得不可或缺,仅仅是因为 IOI 被当成了一个聚合任务。一旦把子任务拆开,核心的"必要性"就烟消云散了。

分布式稠密电路假说

论文的核心理论贡献——分布式稠密电路假说——为这些实验观察提供了理论解释。该假说通过以下推理路径证明了电路解释非唯一性的必然性:

  1. 线性化:在温和的局部线性假设下,任务相关的读取(readout)可分解为各条边贡献之和,每条边有各自的"签名"向量
  2. 求和:一个电路的读取效果近似等于所含边签名之和,外加可控余项
  3. 碰撞:s 条边的电路有 C(|E|, s) 种组合可能性(随模型深度和宽度组合爆炸式增长),而量化后的读取空间只有有限个"桶"——鸽笼原理保证必然存在两个不同的边子集落进同一个桶
  4. 拉开距离:填充(packing)论证可以从碰撞对中挑出边集重叠极低(而非近乎重复)的电路
  5. 保持预测标签:只要 logit 扰动小于任务间隔(margin)的一半,arg max 预测就不会改变

把五步串起来就得到存在性结论:存在多条稀疏、高任务性能、低重叠的电路。非唯一性,是稠密、高维、叠加式计算的自然产物。

对可解释性研究的含义

这篇论文并没有否定 CSD 的价值——它发现的机制依然是有意义的、因果相关的。它真正动摇的是解读这些机制的方式。一条被发现的电路,不应再被当作"那个支撑任务的机制"来宣称——它只是由功能等价机制构成的空间里的一种实现。

那种朴素的还原论视角(把一个任务的行为归因于一个唯一、稀疏、不可或缺的子图)已经不足以解释观察到的非唯一性。取而代之的是一种更分布式的计算机制理解:任务行为源自一群共存且部分冗余的稠密机制的共同作用。

旧范式(功能各向异性) 新范式(分布式稠密电路)
每个任务对应唯一核心电路 同一任务由多条等功电路实现
电路发现的目标是找到"那个"机制 目标是发现机制空间的结构
压缩终将收敛到核心 压缩揭示更多互不等价的实现
多样性是噪声 多样性是本质特征

实践启示

  1. 电路发现的结论需要更谨慎的解读——当你发现一条电路时,它只是无数可行实现之一,不应被当作"那个"解释。在论文中宣称"我们找到了模型如何做 X"时需要附加条件

  2. "三条边核心"的消失教会我们:任务粒度决定了非唯一性的程度——在更细粒度的任务定义下,被"证明不可或缺"的组件可能被绕过。做电路分析时,任务分解的粒度直接影响结论的可靠性

  3. 分布式稠密电路假说提供了理论界碑——非唯一性不是 bug,而是高维叠加计算的特征。这为可解释性工具的设计提供了新的约束条件:寻找"唯一解释"可能是一个错误的目标

  4. 对 AI 安全对齐的影响——如果同一个推理能力可以通过完全不同的内部路径实现,对齐干预(如移除"不安全的电路")可能需要更鲁棒的方法。只在一条路径上做对齐,模型可能通过备用路径绕过安全约束

  5. 多方法验证的范式价值——论文在 ACDC、EAP、EP、DiscoGP 四种方法上复制同样的结论,是"跨方法三角验证"的典范——任何单一方法的结论都应通过多种独立方法验证

关联条目

退出

原文存档