NeFut Logo NeFut
EN 管理员登录

[AI学术] 引导更优思考:LLM 偏好对齐的新突破

发布于:2026-07-23 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #optimization

摘要

LLM 偏好对齐旨在根据用户多样化指令优化模型以符合人类偏好。强化学习已成为实现这一目标的主要后训练方法,但现有的代理奖励通常是基于结果的,主要评估最终响应,而对推理过程的指导有限。这使得在多个响应获得相似最终评分时,信用分配变得粗糙,推理过程中偏好未得到充分说明。

为了解决这一局限性,我们提出了思考检查奖励(TCR),这是一种面向过程的奖励机制,用于基于 RL 的偏好对齐。TCR 将偏好对转换为样本特定的思考检查表,并利用它们来评估生成的推理轨迹是否考虑了偏好所隐含的因素。

为了减少与结果级监督的重叠,TCR 进一步引入了指数移动平均(EMA)残差公式,以隔离超出结果奖励可预测部分的补充思考盈余。针对来自三个模型系列的五个模型的实验表明,TCR 在多样化基准测试中一致提高了对齐性能,消融实验进一步验证了基于 EMA 的残差公式和样本特定检查表监督的重要性。

博主点评: 该研究通过提出思考检查奖励(TCR),有效解决了传统结果导向奖励在推理过程中的不足,展现了 RL 在 LLM 偏好对齐中的新应用。这种过程导向的奖励机制不仅提升了模型的对齐性能,还为未来的研究提供了新的思路。

原文链接: https://arxiv.org/abs/2607.19824

[h] 返回首页