最近的一篇研究提出了一种新的训练框架,称为评估条件训练(Evaluation-Conditioned Training,ECT)。这种方法旨在提高大型语言模型(LLMs)在不完善的反馈信号下的性能。ECT 的基本思想是使用自然语言来条件化每个训练样本的反馈信号的可靠性,然后在部署中使用高保真度的监视器来诱导期望的行为。这种方法可以作为现有算法(如 SFT 和 PPO)的补充。研究人员首先提出了 ECT 的概念框架,并讨论了其潜在的优势。然后,他们在诱导潜在知识(ELK)问题的背景下阐述了 ECT 的重要性。最后,研究人员评估了 ECT 在两个实验中的性能:提高新闻文章生成的公正性和减少算术任务中的阿谀奉承。在每个场景中,研究人员都使用了不完善的反馈信号,分别奖励偏见和与用户的协议。结果表明,ECT 相对于直接训练来说,能够改善目标行为。 博主点评: 评估条件训练为大型语言模型的训练提供了一个新的思路,尤其是在面对不完善的反馈信号时。这种方法的潜在优势在于能够提高模型的泛化能力和鲁棒性,值得进一步研究和探索。