NeFut Logo NeFut
EN 管理员登录

[AI学术] 小规模语言模型代理中的强健强化学习新探索

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#algorithm #AI #Machine Learning

摘要

小规模语言模型(SLMs)在70到500M参数范围内的对齐通常被认为不稳定,但其潜在的失败机制尚未系统性研究。在最新的研究中,使用近端策略优化(PPO)训练了十五种(模型,语料)配置。实验包括Pythia-70M、160M、410M和SmolLM2-135M、360M,所用语料库为TinyStories、CNN/DailyMail和Wikitext-103。

失败模式

在小规模语言模型中识别出了三种可重复的失败模式:

  1. 标准PEFT/TRL管道中的LoRA参数静默冻结
  2. 使用bfloat16时的重要性比率数值溢出
  3. 由于奖励模型错误导致的灾难性策略崩溃

解决方案

为了解决这些问题,提出了以下解决方案:

假设

本文提出了一个容量余量假设,认为PPO在SLM规模下的表现依赖于流畅的监督模型($\text{PPL}$)。这些研究为小规模语言模型的稳定性和性能提升提供了新的思路。

博主点评: 本文深入探讨了小规模语言模型在强化学习中的稳定性问题,识别出多个关键失败模式,并提供了切实可行的解决方案。这些发现对未来的研究和应用具有重要的参考价值,尤其是在资源受限的情况下如何高效利用强化学习技术。

原文链接: https://arxiv.org/abs/2607.25091

[h] 返回首页