摘要
直接偏好优化(DPO)作为基于PPO的RLHF的高效替代方案,在知识密集型生成上表现不足:来自人类注释者或LLM评估者的标准偏好信号存在系统性的冗长偏见,奖励流畅性而非逻辑正确性。这一盲点导致逻辑对齐的缺口——尽管生成流畅文本,SFT模型在NLI蕴含上仅达到0.05-0.22。
我们提出了RLearner-LLM,采用混合DPO:一种自动化的偏好管道,融合DeBERTa-v3 NLI信号与验证器LLM评分,消除人类注释,同时克服单信号优化的“对齐税”。
在五个学术领域(生物学、医学、法律)中,使用三种基础架构(LLaMA-2-13B、Qwen3-8B、Gemma 4 E4B-it)进行评估,RLearner-LLM在NLI上实现了高达6倍的提升,15个单元中获得NLI增益,并在答案覆盖方面保持一致的改进。在Gemma 4 E4B-it(有效参数4.5B)上,混合DPO在五个领域中的四个领域提升NLI(+11.9%到+2.4倍),并在所有五个领域中实现更快的推理,能够缩减至紧凑的基础模型而不失去对齐税的缓解。
我们的Qwen3-8B RLearner-LLM在与自身SFT基线的成对比较中获胜95%;反过来,GPT-4o-mini在我们的简洁输出中获胜95%——同时,这位评估者对我们DPO模型的冗长SFT给予69%的胜率,这在前沿比较器中复制了冗长偏见,并促使在知识密集型生成中使用逻辑感知度量(NLI、ACR)而非LLM作为评判者。
博主点评: RLearner-LLM通过引入混合DPO有效解决了流畅性与逻辑性之间的矛盾,展现出在知识密集型生成任务中的优势。其基于DeBERTa-v3的策略为大语言模型的进一步优化提供了重要的思路,值得关注与深入研究。