近年来,大语言模型(LLMs)在数学和科学等领域的应用日益广泛。常规方法是将问题呈现给模型,并使用其答案作为提出的解决方案。然而,除了这个最佳猜测之外,发现可以通过增加测试时间计算来增强。在称为pass@k的过程中,允许模型探索解决方案空间并生成多样化的候选解决方案。不幸的是,通过强化学习(RL)对大语言模型进行后期训练的标准方法可能会限制pass@k:模型的输出分布在高奖励输出周围变窄,导致解决方案覆盖率崩溃。另一种方法是使用进化策略(ES),一种基于群体的、无梯度的后期训练方法,通过随机扰动直接在权重空间中优化。如本文所示,ES比RL实现了更高的pass@k,并产生了更广泛的输出分布和更大的解决方案覆盖率。这种覆盖率反过来又使得在标准数学基准测试中实现更好的结果成为可能。因此,ES为后期训练在发现问题和其他领域提供了更好的基础,在这些领域,多样化的解决方案覆盖率至关重要。 博主点评: 进化策略在提高大语言模型的解决方案覆盖率方面展现出了优势,相比传统的强化学习方法,进化策略能够提供更广泛的输出分布和更好的解决方案覆盖率,这对于数学和科学等领域的应用具有重要意义。