NeFut Logo NeFut
EN 管理员登录

[AI学术] 稀疏读出棱镜:用特征而非词元解释 Logit‑Lens 分数

发布于:2026-09-04 22:00 最后更新:2026-09-05 12:23
#algorithm #AI #LLM

语言模型在每层对下一个词元的预测会逐步形成,lens 方法通过将中间隐藏状态解码为词元来追踪这一过程。解码实际上同时依赖隐藏状态本身和用于映射的读出矩阵(未嵌入矩阵)。多数 lens 在特定语料上进行拟合,实验表明,仅更换拟合语料而保持模型不变,就会得到不同的词元预测,这种现象称为语料条件性。

为了在不受语料影响的前提下研究读出结构,本文提出稀疏读出棱镜(Sparse Readout Prism,SRP)。SRP 仅利用读出矩阵的权重,将其分解为稀疏特征,并能够把任意词元的 logits 或 logits 差表示为这些稀疏特征贡献的加和。

通过这种表示,读出特征成为 lens 解释的新基本单元,能够揭示词元身份掩盖的结构,并实现跨词元、上下文、层以及不同 lens 的对比。用 SRP 的稀疏近似替代原始读出矩阵,在六种基于几何关系的基线中,能够额外重建 8.9%‑17.3% 的 logits 差。对特征进行消融实验时,logits 差会按其在 SRP 中的贡献比例变化。虽然不同语料会导致词元读取差异,但主导的读出特征保持稳定。因为 SRP 的构建不依赖任何语料,它为 lens 分析提供了独立于语料的对照。

点评

原文链接: https://arxiv.org/abs/2609.01936

[h] 返回首页