NeFut Logo NeFut
EN 管理员登录

[AI学术] S^3martCirc:自监督智能电路发现

发布于:2026-09-03 22:00 最后更新:2026-09-04 02:14
#AI #Machine Learning #LLM

大型语言模型(LLM)在文本摘要、问答等任务上表现卓越,但其内部决策过程仍然是黑箱。机制可解释性(MI)旨在通过逆向工程将神经网络转化为人类可理解的算法。现有的 MI 方法通常采用两阶段流程:先定位重要组件(电路发现),组件多为单个注意力头或前馈神经元;再对这些组件在特定任务中的作用进行功能解释。然而,这种顺序化的做法忽视了组件重要性与功能角色之间的相互依赖。统一这两阶段面临两大难题:①功能角色往往绑定于特定节点,导致难以跨任务泛化;②角色识别依赖主观解释,缺乏可量化指标。为此我们提出 S^3martCirc(Self-supervised Smart Circuit Discovery),在同一框架内同步发现电路并解释功能。S^3martCirc 将节点行为抽象为两类通用计算角色,并给出量化指标用于分配角色,使重要性与功能角色能够联合学习而非顺序推断。大量实验表明,本文框架在电路发现任务上显著优于现有方法。

点评

原文链接: https://arxiv.org/abs/2609.00755

[h] 返回首页