在可验证奖励的强化学习(RLVR)中,尽管其广泛应用于提升大型语言模型(LLMs)的推理能力,但其模型的泛化能力仍然不甚明确。本文首次建立了在十亿参数规模下,针对参数高效的RLVR微调的非空泛化界限。我们的方案将PAC-Bayes压缩界限适配于此场景,并通过应用Gumbel-max重参数化技巧来解决生成令牌的固有随机性。
为了实现这些界限,我们提出了渐进式RLVR框架,该框架将RLVR与在线策略蒸馏、TinyLoRA和模型量化相结合。渐进式RLVR在保持标准LoRA微调84-97%性能的同时,生成的模型可压缩度达到14,796倍。我们展示了该框架在数学问题解决、编程、常识推理和文本到SQL四个领域中产生了非空泛化界限。我们的界限在准确性上超过基础模型9-51%,并与微调模型的准确性相差6-11%。
博主点评: 本文通过引入渐进式RLVR框架,成功在可验证奖励的强化学习中突破了泛化界限,为大规模语言模型的应用提供了新的思路,尤其在模型压缩和性能保持方面的巨大进展值得关注。该研究为理解RLVR的泛化能力奠定了重要基础。