大型语言模型(LLM)在文本摘要、问答等任务上表现卓越,但其内部决策过程仍然是黑箱。机制可解释性(MI)旨在通过逆向工程将神经网络转化为人类可理解的算法。现有的 MI 方法通常采用两阶段流程:先定位重要组件(电路发现),组件多为单个注意力头或前馈神经元;再对这些组件在特定任务中的作用进行功能解释。然而,这种顺序化的做法忽视了组件重要性与功能角色之间的相互依赖。统一这两阶段面临两大难题:①功能角色往往绑定于特定节点,导致难以跨任务泛化;②角色识别依赖主观解释,缺乏可量化指标。为此我们提出 S^3martCirc(Self-supervised Smart Circuit Discovery),在同一框架内同步发现电路并解释功能。S^3martCirc 将节点行为抽象为两类通用计算角色,并给出量化指标用于分配角色,使重要性与功能角色能够联合学习而非顺序推断。大量实验表明,本文框架在电路发现任务上显著优于现有方法。
点评