NeFut Logo NeFut
EN 管理员登录

[AI学术] 大型语言模型的逻辑一致性挑战:受控重述测试新基准

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#algorithm #AI #Machine Learning

摘要

大型语言模型(LLMs)在逻辑上等价的问题表述变化时,常常会出现自我矛盾。为此,我们提出了一个包含350个问题家族(共1750个问题)的基准测试——受控重述测试(CRTBench),以评估逻辑不变性。该基准测试旨在调查LLMs在受控重述中的一致性回答能力,包括逆否命题重写、双重否定、否定翻转和被动语态等。

我们评估了几种前沿的LLMs,并观察到准确性与一致性之间存在差距。例如,GPT-5.4-mini在基础准确率上达到了$98.9\%$,但在家族级一致性上仅为$60.3\%$,而经过推理优化的o4-mini则达到了$96.9\%$的一致性。实验结果显示,失败主要集中在逻辑上非平凡的变换上,如逆否命题重写(GPT-5.4-mini为$72.4\%$)和双重否定($84.6\%$),而表面重述的鲁棒性则保持在$94-100\%$。

提高推理努力能够将GPT-5.4-mini的一致性提升至$85.4\%$,但对于GPT-5.4整体表现没有显著改善,因为在嵌套否定上的收益被量词家族的失败所抵消。这些结果表明,仅凭准确性不足以评估LLMs的逻辑推理能力。

博主点评: 本文揭示了大型语言模型在逻辑推理方面的薄弱环节,尤其是在面对复杂的逻辑变换时。这为未来的研究提供了重要的方向,旨在提升模型的逻辑一致性和推理能力,值得关注。

原文链接: https://arxiv.org/abs/2607.14528

[h] 返回首页