在现有的幻觉检测方法中,通常是在推理阶段进行,而不对模型本身进行任何修改。本文探讨了增强模型幻觉可检测性的微调策略。我们聚焦于基于语义熵的检测,发现许多错误输出因为模型在多次运行中产生几乎相同的错误答案而未被检测到。
为了解决这个问题,我们提出了多样性导向的微调,鼓励生成更多样化的输出。具体而言,我们引入了两种策略:一种基于监督微调(Supervised Fine-Tuning,SFT),另一种基于直接偏好优化(Direct Preference Optimization,DPO)。
通过大量实验,我们评估了该方法,并分析了模型在微调前后的行为。结果显示,采用我们的微调方法后,模型生成低语义熵响应的概率减少,从而提高了幻觉检测的有效性,最终取得的结果优于或与现有最先进的方法相当。
代码将会公开发布。
博主点评: 本文提出的多样性导向微调策略为幻觉检测提供了一种创新的思路,通过鼓励模型生成多样化的输出,有效提高了幻觉的可检测性,具有较高的实用价值和应用前景。期待代码的开源,推动相关研究的发展。