NeFut Logo NeFut
EN 管理员登录

[AI学术] 揭秘大型语言模型的隐藏状态

发布于:2026-08-12 22:00 最后更新:2026-08-13 01:53
#Machine Learning #LLM #Open Source #Artificial Intelligence #GPT

最近的一项研究提出了一种名为 OmniLens 的方法,用于解释大型语言模型(LLMs)的隐藏状态。这种方法通过将中间激活映射到输出词汇表,揭示了下一个标记预测如何通过网络发展。然而,训练好的透镜参数的增长与模型宽度的平方成正比,而精确的、全词汇 Kullback-Leibler(KL)训练则占据了大量内存。因此,之前的研究仅限于 20B 参数以下的模型,并且与特定的组件类型绑定。OmniLens 提出了一种单一的透镜家族,可以应用于任意宽度的激活,无论是残差流、注意力还是多层感知器(MLP)。此外,它结合了两种独立的缩放技术:低秩翻译器和子集 KL。低秩翻译器使得每个透镜的参数增长与模型宽度成线性关系,并将可训练参数减少了多达 98.4%。子集 KL 仅计算选定的词汇日志值:其 Top-k 模式将峰值训练内存减少了多达 70%,而其重要性采样变体保持了对全 KL 的无偏随机梯度。这些节省使得我们能够为 LLaMA-3.3-70B 模型创建一个由 482 个透镜组成的密集集成,从而在相同的深度上提供了 6 倍的覆盖范围。这种模型范围的覆盖揭示了单个组件透镜无法看到的东西:行为最明显的组件不一定是最有效的干预点,而且最有效的干预措施位于之前的透镜研究中所检查的注意力头之外。在三个案例研究(提示注入检测、多跳内存注入和有害性定位)中,OmniLens 在大大降低成本的同时复制了关键的已发表结果。 博主点评: OmniLens 的提出标志着大型语言模型解释领域的一个重大突破,它使得我们能够更好地理解这些模型的内部工作机制,并为未来的模型优化和应用提供了新的思路和方法。

原文链接: https://arxiv.org/abs/2608.10260

[h] 返回首页