NeFut Logo NeFut
EN 管理员登录

[AI学术] 揭示延迟泛化的奥秘:权重衰减时钟中的层级机制

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#Machine Learning #optimization #Neural

在对延迟泛化(或称为 grokking)的深入研究中,我们发现了一个在全批量重力球优化和权重衰减下的线性模型中的可解晚期松弛机制,并将其扩展到非线性神经网络。

我们分析出了一种特殊的人口活跃组件,称之为 grokking 子空间。在这个子空间内,训练预测保持不变,权重衰减成为唯一的恢复力,导致由离散时间和连续时间法则主导的缓慢耗散松弛。

我们证明,只有这个子空间对人口风险的缓慢渐近衰减有所贡献,并推导出 grokking 时间的显性迭代规模预测,恢复了在弱正则化条件下的 $(1-\eta)/(\eta\lambda)$ 规模。

该理论进一步预测了优化器选择的不同效果,区分了耦合的 $L_2$ 正则化和解耦的权重衰减,并为修改 grokking 组件的干预措施提供了因果预测。

我们在一个合成模型中验证了所有理论身份,模型中每个子空间和松弛速率均可闭合计算。此外,我们在模块加法中观察到了真正的延迟泛化,测得的延迟遵循预测的规模,且晚期松弛与理论时钟紧密吻合。

博主点评: 本文深入探讨了 grokking 现象的机制,提出了新的数学模型和预测,具有重要的理论价值与应用潜力。对优化器选择的影响分析为算法设计提供了新的视角,为今后的研究指明了方向。整体来看,这一研究在理解深度学习模型的泛化能力上具有里程碑式的意义。

原文链接: https://arxiv.org/abs/2607.23967

[h] 返回首页