在本文中,我们探讨了大型语言模型(LLMs)在面对不同但等价的问题表述时的可靠性。尽管LLMs在基准测试中通常表现出强大的准确性,但它们在应用这些知识时的稳定性仍不明确。
我们对四个基准和13个模型进行研究,发现模型的输出往往依赖于提示的具体措辞。总体准确性在不同的表述中变化有限,但实例级行为却表现出较大的不稳定性:对于许多问题,模型的回答会根据措辞的不同而在正确与错误之间切换,不匹配率超过23%。
当我们关注那些在原始形式下正确回答的问题时,答案翻转率甚至显示出更大的失败,表明单一提示的正确性往往不是可靠性的良好指标。尽管如此,我们发现模型通常会为问题的至少一个同义表述产生正确答案,这表明潜在知识存在但检索不一致。
在此基础上,我们展示了一种简单的自我同义表述策略可以部分恢复这些潜在知识,并在推理时提高性能。这些发现表明,标准的准确性指标可能掩盖了显著的不稳定性,而在等价输入之间评估一致性可以更清晰地反映LLM的可靠性。
博主点评: 本文揭示了大型语言模型在处理同义句时的可靠性问题,强调了准确性指标的局限性,并提出了自我同义表述作为改善性能的潜在策略。这对进一步提升LLM的实用性具有重要意义。