稀疏自编码器的可分解性和特征归因的集中度常被视为模型计算易于逆向工程的证据。本文直接检验这种表征简洁性是否真的对应更小或更易处理的因果电路。
我们以同一预训练的 GPT-2 Small 检查点为起点,分别进行标准连续训练和对抗连续训练。两种条件都必须在间接宾语识别(IOI)任务上保持同等能力,并通过独立的鲁棒性验证后再比较内部机制。
比较维度包括三方面:稀疏自编码器(SAE)的可分解性、任务归因中 SAE 特征的使用情况,以及从原始计算图中恢复的忠实电路规模。电路规模以在固定忠实度阈值下重建模型行为所需的因果结构边数衡量。
实验发现,鲁棒模型在 SAE 可分解性上更佳,且在任务归因时动用的 SAE 特征更少。电路规模呈阈值依赖性:在 85% 以下的忠实度,标准模型的边数不劣于或等于鲁棒模型;但在 90% 与 95% 高忠实度时,鲁棒模型显著使用更少的边。该趋势在主实验对以及跨七个阈值的扫掠和第二语料库上均得到复现。
结论是,表征或归因的简洁性并不必然转化为整体电路的简化,只有在高忠实度阈值下才表现出规模优势。这是首次通过受控实验检验表征简洁性与因果电路简洁性之间关系的实证研究。
点评