语言模型在每层对下一个词元的预测会逐步形成,lens 方法通过将中间隐藏状态解码为词元来追踪这一过程。解码实际上同时依赖隐藏状态本身和用于映射的读出矩阵(未嵌入矩阵)。多数 lens 在特定语料上进行拟合,实验表明,仅更换拟合语料而保持模型不变,就会得到不同的词元预测,这种现象称为语料条件性。
为了在不受语料影响的前提下研究读出结构,本文提出稀疏读出棱镜(Sparse Readout Prism,SRP)。SRP 仅利用读出矩阵的权重,将其分解为稀疏特征,并能够把任意词元的 logits 或 logits 差表示为这些稀疏特征贡献的加和。
通过这种表示,读出特征成为 lens 解释的新基本单元,能够揭示词元身份掩盖的结构,并实现跨词元、上下文、层以及不同 lens 的对比。用 SRP 的稀疏近似替代原始读出矩阵,在六种基于几何关系的基线中,能够额外重建 8.9%‑17.3% 的 logits 差。对特征进行消融实验时,logits 差会按其在 SRP 中的贡献比例变化。虽然不同语料会导致词元读取差异,但主导的读出特征保持稳定。因为 SRP 的构建不依赖任何语料,它为 lens 分析提供了独立于语料的对照。
点评