NeFut Logo NeFut
EN 管理员登录

[AI学术] 小型语言与视觉语言模型中的GRPO学习率失效机制探讨

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:46
#Machine Learning #optimization #Reinforcement Learning

摘要

强化学习与可验证奖励,特别是群体相对策略优化(GRPO),现在常在监督检查点上运行,以期产生更强的智能体。本文探讨了在4B到8B规模的小型语言和视觉语言模型网络智能体中,GRPO是否能增加技能,或者只是重塑了已掌握的行为。

在18次实验中,调整学习率、KL权重、种子、初始化和裁剪等配置,均未显著提高强监督基线的成功率。在文本轨道中,中等到高的学习率反而使成功率显著下降。这个结果在配对测试、25个评估种子、6个训练种子、配方变化及文本和Set-of-Marks截图观察中都得以保持,而在将骨干网络扩展到8B时,可信的损害仅在文本轨道中发现。

为了证明这一结论反映了设置而非管道问题,我们在可通过采样获得奖励的任务上运行相同的架构、奖励和配方,成功率上升了22个百分点,且配对区间不包含零。因此,GRPO仅在有提升空间时有效,意味着采样策略的成功率已经高于贪婪策略。

接下来,我们解释了失效原因:中等学习率会降低智能体性能,而高学习率则导致其崩溃,这两个状态形成双重解离:局部化的降级状态集中在注意力和多层感知器模块,而崩溃状态则无法归因于任何单一组,主导权重移动的嵌入变化在因果上是无效的。在4B模型中,后期层的有效秩与能力呈正相关,而在8B模型中则出现分离。这种耦合特性特定于较小模型,因此我们将其报告为规模依赖性。

博主点评: 本文深入探讨了GRPO在小型模型中的失效机制,揭示了学习率对智能体性能的复杂影响,为未来的模型优化提供了重要参考。通过系统的实验设计,作者有效地排除了其他变量的干扰,展示了强化学习在特定条件下的局限性。这为研究者在选择学习策略时提供了宝贵的经验教训。

原文链接: https://arxiv.org/abs/2607.12640

[h] 返回首页