摘要
小规模语言模型(SLMs)在70到500M参数范围内的对齐通常被认为不稳定,但其潜在的失败机制尚未系统性研究。在最新的研究中,使用近端策略优化(PPO)训练了十五种(模型,语料)配置。实验包括Pythia-70M、160M、410M和SmolLM2-135M、360M,所用语料库为TinyStories、CNN/DailyMail和Wikitext-103。
失败模式
在小规模语言模型中识别出了三种可重复的失败模式:
- 标准PEFT/TRL管道中的LoRA参数静默冻结。
- 使用bfloat16时的重要性比率数值溢出。
- 由于奖励模型错误导致的灾难性策略崩溃。
解决方案
为了解决这些问题,提出了以下解决方案:
- 合并和重新初始化适配器技术。
- 在PPO更新中使用float32精度。
- 三层安全机制,包括奖励白化、重要性比率保护和权重回滚。
假设
本文提出了一个容量余量假设,认为PPO在SLM规模下的表现依赖于流畅的监督模型($\text{PPL}$)。这些研究为小规模语言模型的稳定性和性能提升提供了新的思路。
博主点评: 本文深入探讨了小规模语言模型在强化学习中的稳定性问题,识别出多个关键失败模式,并提供了切实可行的解决方案。这些发现对未来的研究和应用具有重要的参考价值,尤其是在资源受限的情况下如何高效利用强化学习技术。