我们关注 Transformer 中记忆向概括转变的功能位置。为此提出 Transition Games——一种行为对齐的精确激活博弈,配对非概括控制组。实验发现,加入对块 0(block‑0)注意力的前置偏置后,模型表现出分布式效用提升;在替换实验中,度为二的模式解释了 67%–92% 的对比增益。进一步的精确路径分析表明,块 1(block‑1)MLP 对这些增益的贡献超过所有下游路径,在 12 对实验中均占主导。
传统的 “MLP 记忆,注意力概括” 预测在本实验中被完全颠倒:记忆锚点处每例信息下降 $.331$ 位,且 12/12 对实验的方向与预测相反。其他假设如路由启动、全局秩塌陷以及保持质数不变的结构岭也未能解释观察到的现象。综合来看,grokking 在此表现为对已有分布式电路的谱(傅里叶)重编码,而非模块之间的切换。
点评