否定在不同领域并没有统一的解释。法律、监管和医学推理中,所采用的解释取决于所使用的语义:开放世界 vs. 闭合世界、二值 vs. 三值、以及信任式 vs. 怀疑式推理。我们调查了大语言模型(LLM)默认采用哪种否定语义,以及在明确指定另一种语义时是否能够覆盖默认偏好。
为此我们推出 NAFBench,一个过程化生成器,可产生经求解器认证的实例,覆盖四种语义视角:SLDNF、良好定义语义(WFS)、以及稳定模型语义下的信任式和怀疑式推理。生成器输出具有受控深度、宽度和循环结构的地面普通逻辑程序。每个程序使用 SWI‑Prolog、WFS 求解器和 clingo 分别求解,得到最多四个可能不一致的标签。随后将程序以多种叙述方式和规则顺序转化为自然语言,保证答案保持不变。
实验结果揭示了一个持续的差距:在开源模型中,遵循指定否定语义仍未解决——最强模型在四种语义视角上的得分为 59%–74%,最弱模型为 31%–67%。超过一半的规则顺序重排会导致模型表现出顺序敏感性;较弱的模型在良好定义语义的“未定义”情形上经常过度承诺。两款前沿模型在主固定复杂度评估集上达到了 100%,另一款 o4‑mini 接近完美,仅在良好定义“未定义”上跌至 81%。将推理委托给求解器、在认证轨迹上微调,或强制输出显式的三值判定,都能在一定程度上缩小差距。
点评:本工作首次系统化评估 LLM 对不同否定语义的遵循能力,提供了可复现的基准 NAFBench,并指出当前模型在语义一致性和顺序鲁棒性方面仍有显著提升空间。未来可通过更深层的语义对齐训练和混合求解框架进一步提升模型的可靠性。