NeFut Logo NeFut
EN 管理员登录

[AI学术] 量化记忆到泛化的转变:Grokk​ing 的尺度律与相位结构

发布于:2026-09-12 22:00 最后更新:2026-09-15 01:15
#Machine Learning #optimization #Neural

神经网络在训练超过记忆阶段后,常会出现一次延迟的泛化转变,这一现象被称为 grokking。已有理论解释了 为何 会出现这种转变,但对 何时 在超参数空间中发生的定量结构仍缺乏描述。我们在模数运算任务上,对两层隐藏层 MLP 的 384 种配置进行了系统实验,绘制了记忆‑泛化边界,并拟合出泛化出现时间的幂律尺度关系:

$$T_{\mathrm{grok}} \propto H^{-0.27}\, D^{-2.04}\, \eta^{-0.50}\, \lambda^{-0.64}$$

其中 $H$ 为隐藏层宽度,$D$ 为数据复杂度(即训练样本数),$\eta$ 为学习率,$\lambda$ 为权重衰减系数。模型的决定系数 $R^2$ 为 0.732,加入交互项后提升至 0.821。指数大小的层级表明,数据复杂度 $D^{-2.04}$ 是驱动转变的主要因素,而模型容量 $H^{-0.27}$ 的影响相对较小:将数据量翻倍可将泛化时间加速约 4 倍,而将宽度翻倍仅提升约 1.2 倍。

我们还观察到在权重衰减 $\lambda \gtrsim 1.0$ 时出现一条明显的相位边界,将 grokking 配置与非 grokking 配置分隔开来。权重范数随训练过程呈单调压缩趋势,表明隐式正则化倾向于选择低复杂度的解,这与理论预测一致。

这些实验结果为在过参数化网络中预测和控制记忆‑泛化转变提供了量化依据,也暗示通过调节数据规模和正则化强度可以有效管理模型的学习行为。

点评

原文链接: https://arxiv.org/abs/2609.10657

[h] 返回首页