摘要
现有假设将大型语言模型(LLM)中的概念表示为单个点、线性方向或高斯聚类,但这些结构如何及为何出现仍不清楚。本文展示了如何通过拉盖尔几何精确表征概念几何,其中概念被定义为区域——拉盖尔-沃罗诺伊单元或单元的联合,允许我们严格定义、测量和区分概念。
基于此公式,我们表明更细粒度的概念结构,如包含关系和层次结构,能够通过拉盖尔权重自然显现。接着,我们将这种几何推入变换器内部。将每一层分解为分段线性算子,我们展示了一个令牌的隐含轨迹由两个耦合机制支配:一个是自包含的分段线性流的静态树,另一个是在跨令牌注意力触发时跨树跳跃的动态传输。这种分解产生了几何透镜(Geometric Lens),一种无训练、无超参数的方法,用于读取任何层中隐含向量所编码的确切概念。
我们还开发了拉盖尔自编码器(Laguerre Autoencoder),一个二维可视化工具,可以在一个视图中渲染决策几何和模型的完整推理轨迹。最后,我们超越了解释几何,朝向可操作的可解释性,展示了几何透镜在模型受到上下文干扰时能够恢复正确的事实令牌。代码已在 GitHub 上发布。
博主点评: 拉盖尔几何为理解大型语言模型提供了新的数学框架,突破了传统概念表示的局限性。这种方法不仅为研究人员提供了更清晰的模型内部结构视图,还为实际应用中的可解释性提供了有力工具,显示出在复杂模型中解读信息的新可能性。