在评估大型语言模型的多跳推理能力时,面临着重大挑战。尽管当前模型在现有的多跳问答数据集上取得了良好的结果,但这种表现往往掩盖了两个关键弱点:
- 依赖内部参数知识而非遵循提供的上下文;
- 利用数据集捷径,如单文档提示或类型匹配,从而减少了对跨多个文档进行真正证据聚合的需求。
为了解决这两个问题,我们引入了CRiT-QA(反事实推理与陷阱),这是一个专门设计的数据集。CRiT-QA通过使用反事实实体转化事实推理链,以消除对记忆知识的依赖并强制执行严格的上下文依赖。此外,它还注入了多锚定的干扰链,这些链是合理但错误的推理路径,在不同的跳跃处发生偏离。这些陷阱要求模型遵循整个推理过程,而不是利用肤浅的启发式方法。
我们的实验表明,与标准数据集相比,LLMs在CRiT-QA上的性能显著下降,暴露了它们在反事实条件和干扰陷阱下的脆弱性。因此,CRiT-QA作为评估真正多跳推理的严格诊断工具,为开发更可靠、基于证据的LLMs奠定了基础。
博主点评: CRiT-QA的引入为评估语言模型的推理能力提供了新的视角,尤其是在多跳推理场景中。通过设置反事实条件和干扰路径,研究者能够更清晰地识别和理解模型的局限性,这对于推动更强大和可靠的AI系统至关重要。