NeFut Logo NeFut
EN 管理员登录

[AI学术] 重新审视Muon:矩阵分解中的优化器表现

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:19
#algorithm #Machine Learning #optimization

Muon最近被认为是大规模深度学习中的强大优化器,它通过近似正交化来重塑梯度更新,并在大语言模型训练中被报道超越了Adam和AdamW。其经验成功激发了越来越多的理论研究,将Muon解释为在谱范数下的最陡下降。然而,目前尚不清楚Muon的哪些优势源于其更新规则本身,哪些是现代深度网络的规模、架构和数据的伪影。为了隔离优化器与这些混杂因素,我们在一个简单、易于理解且具有谱结构的问题上研究了Muon:低秩矩阵分解。通过与经过精心调整的自适应基线进行受控比较,我们发现Muon在此环境中并不总是优于AdamW,并且一些先前报告的优势对超参数选择非常敏感。我们的结果提供了一个更细致的视角,说明何时谱感知的正交化是有益的,并主张在控制问题上评估现代优化器,而不仅仅是在端到端基准上进行评估。

博主点评: Muon作为新兴的优化器,其理论与实践的结合仍需深入探讨。此次研究揭示了在特定条件下,优化器的表现可能并非一成不变,强调了实验设计与超参数调优的重要性。

原文链接: https://arxiv.org/abs/2607.13246

[h] 返回首页