在新研究中,Muon优化器在模数运算上的grokking阈值达成速度超过了AdamW。以往的研究将这一现象归因于“谱范数约束与正交动量”,但并未明确指出具体机制。为了深入理解Muon的行为,我们进行了多种种子和学习率的实验,以分解并测试其效果。
首先,通过消融实验表明,加速来自于正交化(牛顿-舒尔茨迭代):仅正交化的优化器速度与完整的Muon相匹配,而仅使用谱范数的优化器速度不及AdamW且不可靠,这一结论在不同学习率下均成立。
其次,机制分析发现,正交化的优化器在大约3倍更低的谱范数下达到泛化,而在控制嵌入移动量的情况下,最终收敛于一个更低范数的解,而不仅仅是减少嵌入的扰动。
第三,将牛顿-舒尔茨迭代次数从五次减少到一次加速了阈值的达成,但使得groked解变得脆弱,容易发生瞬时崩溃,这种脆弱性随着学习率的增加而加剧;在小学习率下,单次迭代是快速且稳定的,而经典的五次迭代则是对学习率鲁棒的选择。
此外,我们还表明在没有测量成本的情况下可以去掉谱缩放。研究中贯穿了一条方法论的主线:在一个考虑稳定性的度量下,关于grokking优化器的“更快”说法可能会反转,因此我们报告了首次交叉和持续grok时间。为了支持可复现性,我们在 GitHub 上发布了完整的训练和分析代码。
博主点评: 本文深入探讨了Muon优化器的内部机制,尤其是正交化对加速grokking的重要性。通过实验证明,优化器的设计不仅影响速度,还直接关系到解的稳定性,为后续研究提供了重要的参考和启示。希望未来能有更多关于优化器设计的理论与实践结合的研究。