摘要
强化学习从人类反馈(RLHF)在对齐大型语言模型(LLMs)与人类偏好中起着至关重要的作用。然而,其有效性常常受到人类标注固有的不一致性和主观性的影响。现有的偏好优化框架,如直接偏好优化(DPO),通常将高标注者不一致的模糊对与达成一致的对等同对待,迫使模型过度拟合不一致的监督信号,导致次优的对齐。
在本研究中,我们提出了一种可靠性导向的偏好优化(RGPO)框架,旨在减轻不一致人类反馈的影响。RGPO 通过估计标注者的可靠性并从嘈杂的人类反馈中推断潜在的真实标签,以识别稳健的偏好。此外,我们还引入了一种可靠性感知的一致性优化方法,根据标注的一致性水平动态调整训练目标,确保模型优先考虑高一致性的监督信号。
在 LLM 对齐基准上的广泛实验表明,RGPO 有效减少了训练数据中的不一致性和噪声,并且相比广泛采用的 RLHF 基线取得了更优的性能。我们的代码和配置可在 GitHub 上获取。
博主点评: 本文提出的 RGPO 框架为解决人类反馈中的不一致性提供了创新思路,通过动态调整训练目标,显著提高了模型的对齐效果。这一方法在实际应用中具有较高的可行性,值得关注。