语言模型的计算到底占用了多少维度?如果不先指定一个功能函数,这个问题本身是 ill‑posed 的。任务加权图通过在所选功能的度量下,将低维坐标系拟合到模型内部表征上,使得蒸馏等价于普通的最小二乘回归,从而把问题定义清晰。\ \ 在六个模型(覆盖 70M‑7B 参数)上进行实验发现,要让下一个 token 的困惑度偏差保持在 5% 以内,需要保留残差流宽度的 70%‑90%。这部分宽度主要被语言的稀有尾部占据,而方差分布根本预测不到它:GPT‑2 的激活方差有 90% 集中在两条方向上,却几乎不承担任何功能。维度必须按功能来衡量——模型自身的不确定性可以用六个坐标描述,而完整的预测分布则需要数百个坐标,并且随网络深度增加而增长。\ \ 这种功能‑方差的分离是可利用的。当只能保留极少维度时,在功能度量下训练的任务加权图比基于方差的压缩或最优线性压缩更好地保持原始模型的预测。\ \ 点评:任务加权图提供了一种以功能为中心的低维表征方法,揭示了语言模型中“重要”维度并非方差最大的方向,对模型压缩和解释都有重要启示。