稀疏自编码器(SAE)通过稀疏字典原子将大语言模型(LLM)的激活分解为独立特征,使每个概念对应唯一特征。然而,特征吸收现象会导致父概念及其子概念(如水果与{苹果、香蕉、梨})合并为同一方向,破坏这一假设。先前工作仅给出经验观察,缺乏何时共享方向成为代价最优表示的闭式预测。本文针对层次伯努利生成模型推导出相位边界:当有 $k$ 个活跃子概念且残差尺度为 $\alpha$ 时,$L_0$ 正则化的重构目标在 $$\lambda_c(k,\alpha)=\frac{\alpha^2 k}{k-1}$$ 处出现转折;若正则系数 $\lambda>\lambda_c$,则纯父概念吸收的代价严格低于纯子概念编码。基于此边界,我们提出 HiPACE 评估协议:在真实 SAE 字典上测量 WordNet 家族的父子解码器结构,先在发现阶段冻结统计量,再在未见家族上测试,并与随机兄弟对照组比较。实验表明,在合成数据的 30 个单元格中,边界预测误差不超过 $\pm15\%$。在 Pythia‑160m SAE 中,父子解码器差距的排序与理论一致,偏相关最高达 $-0.93$,在锁定持出集上仍保持显著($p=0.002$),且能排除兄弟对照。进一步的激活组合实验将理论中的活跃子数映射到实际家族方向,残差流干预显示,签名家族方向提升父类 logits,符号翻转后效果逆转,随机控制则消失,证明了在家族子空间层面的因果充分性。
点评