NeFut Logo NeFut
EN 管理员登录

[AI学术] 几何视角下的无知:LLM何时调节贝叶斯先验

发布于:2026-09-05 22:00 最后更新:2026-09-06 01:02
#Machine Learning #LLM #Geometry

在语言模型缺乏线索时会预测什么?答案隐藏在其嵌入矩阵的几何结构中。研究发现,未嵌入矩阵(unembedding matrix)中存在唯一的方向,它编码了训练语料的 unigram 分布,这相当于模型在不确定时回退的贝叶斯先验。我们称这一方向为“无知方向”。该现象在 Llama、Qwen、Gemma、Pythia 四大模型族(参数规模 0.4B‑405B)中均有出现。将最终预测状态向该方向投影得到每个 token 的先验加载因子 $\lambda$,实验表明 $\lambda$ 随上下文信息增多而单调下降。形式上,这一投影把预测状态分解为两个正交向量:一个是指数为 $\lambda$ 的 unigram 先验,另一个是由上下文驱动的似然,两者正好对应温化贝叶斯更新的两个因子。该几何‑概率解释为 $\lambda$ 提供了跨模型规模和模型族的可比度,较大的模型在高上下文信息下对先验的依赖更低。进一步实验表明,无知方向具有因果作用:在预测状态上提升或降低 $\lambda$ 会分别使输出在 KL 散度意义上更靠近或远离 unigram 先验。

点评: 该工作揭示了 LLM 内部的概率几何结构,为解释模型在信息匮乏时的行为提供了可量化的工具,也为调节模型对先验的依赖提供了直接的干预手段。

原文链接: https://arxiv.org/abs/2609.02959

[h] 返回首页