在大型语言模型(LLMs)中,强化学习(RL)已成为提升复杂推理任务性能的核心技术。然而,RL后训练往往与其前期的预训练过程孤立研究,导致两个基本问题尚未得到解决:(1) 预训练选择(模型大小、数据)如何影响RL计算的回报?(2) RL对模型的实际影响是什么?这些问题在标准LLM设置中很难研究,因为预训练语料庞大且不受控,难以将行为归因于预训练或RL,而在两个阶段之间进行系统的计算测试又成本高昂。
为了解决这些挑战,我们使用棋类作为受控测试平台,研究从预训练到后训练的推理过程。我们遵循标准的LLM训练流程:从500万到10亿参数的语言模型在真实棋局上进行预训练,使用合成推理轨迹进行监督微调,并在具有可验证奖励的棋类难题上进行RL训练。通过这一框架,我们发现,在给定RL计算水平下,后RL性能能够很好地从预训练损失中预测,而RL奖励曲线的斜率大约随预训练令牌数量线性改善。
超越规模的影响,我们发现RL并不仅仅是对SFT策略的精细化:在简单难题上,它放大了SFT策略已经偏好的正确走法,而在困难难题上,它揭示了在SFT下几乎不存在的正确走法。我们进一步测试了我们的发现是否可以转移到其他领域,通过在数学领域文本上训练一个10亿参数的语言模型,发现相同的预测模式出现:预训练时间更长的检查点在后RL性能上表现更高,并且在RL下提高更快。总之,我们提供了一个定量的预训练到RL接口的描述,并为研究从预训练到后训练的推理科学提供了一个受控测试平台。
博主点评: 本文通过棋类测试平台,深入探讨了预训练与后训练之间的关系,为理解大型语言模型的推理能力提供了新的视角。结果表明,RL不仅能提升模型的表现,还能揭示在传统训练中未能显现的潜力,具有重要的实际意义和研究价值。