NeFut Logo NeFut
EN 管理员登录

[AI学术] 数据驱动的多评估者一致性:优化偏好的新方法

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#AI #Machine Learning #optimization

摘要

研究偏好优化时,通常会在固定数据的情况下变化训练目标。我们提出一个问题:一小部分高置信度的政策响应是否能提供可靠的学习信号?

我们的方法,DMAPO(数据驱动的多评估者一致性偏好优化),生成来自目标政策的候选响应,并利用专门的评估标准评估其帮助性、真实性和简洁性,随后应用过程批评修正,保留高共识的理想或不理想示例。在54,236个Mistral-7B候选中,仅接受了1,871个(3.45%)。基于该数据集训练的KTO在MT-Bench上达到7.50的分数,对比text-davinci-003的长度控制胜率为95.5%,IFEval提示准确率为57.3%。独立的成对评估也显示DMAPO优于SimPO:GPT-4o在129个持出提示上的净胜率为23.3分,在200个分布外的LMSYS-Chat提示上为24.0分;Claude Opus 4.7在持出集上的得分为24.1分。更换评估模型或标准会改变所选示例,但对下游性能影响不大。第二个基准研究显示相似的3.41%接受率,尽管其性能提升较为温和。通过这些实验,我们证明共识过滤为一般指令的偏好优化提供了一条数据高效的途径,但代价是需要额外的策展计算和对评估者判断的依赖。

博主点评: DMAPO方法在偏好优化中展示了数据驱动的潜力,通过高共识示例的提取,显著提高了模型的性能。这种方法不仅减少了依赖于大量数据的需求,还强调了评估者的选择对结果的重要性,推动了偏好优化研究的前进。

原文链接: https://arxiv.org/abs/2607.25136

[h] 返回首页