摘要
Muon在大规模预训练中与AdamW竞争,但其在强化学习(RL)后训练中的价值尚不明确。我们通过与AdamW在ALFWorld上使用Qwen2.5-0.5B-Instruct进行单种子匹配比较,研究了原始Muon在稀疏奖励自主RL中的表现。
在Group-in-Group Policy Optimization (GiGPO)下,仅将Muon应用于隐藏权重矩阵,使最终窗口验证成功率从0.290提高到0.546(+88%);而高频率的AdamW控制组在更新后未能保持成功。该效果依赖于优势估计器和学习率。在3e-5的学习率下,Muon使GRPO从0.161提升至0.268,而GraphGPO的晚期窗口差距接近饱和。在1e-5的学习率下,GraphGPO Muon达到了0.901,将标准化验证AUC从0.399提升至0.556,并在30和60次更新之前分别达到了0.5和0.75的成功率。
这些探索性结果表明,Muon可以为自主强化学习提供帮助,并激励我们共同研究策略优化器、优势估计器和学习率。多种种子和跨任务验证仍然是未来的研究方向。
博主点评: Muon算法在强化学习中的应用潜力令人兴奋,尤其是在稀疏奖励情境下的表现显著提升。这一研究不仅对算法优化具有重要意义,也为后续的多任务学习提供了新的思路。未来的研究可以进一步探索不同参数设置对学习效果的影响。