NeFut Logo NeFut
EN 管理员登录

[AI学术] 揭示黑箱思维:大型语言模型的干预式基础审计

发布于:2026-07-16 22:00 最后更新:2026-07-17 08:45
#Tech

摘要

大型语言模型(LLM)生成的连锁思维(CoT)推理看似逻辑合理,但可能并不真正依赖于其所述的前提。我们提出了干预式基础审计,这是一种黑箱、逐步测试前提依赖性的方法:通过用新符号替换目标谓词来干预单个前提,重新运行模型,并检查每个推理步骤的标准化结论(典范谓词形式)是否发生变化。

我们在 ProntoQA 上进行了评估,这是一个具有金标准证明树的合成多跳推理基准,已知每个步骤的前提依赖性。应用于 50 个 ProntoQA 问题的 GPT-4o,我们的方法在检测证明树依赖性方面取得了 F1 = 0.806 的成绩(谓词决定依赖性 F1 = 0.885;召回率 = 100%),显著优于自一致性基线(F1 = 0.343;95% 自助法置信区间非重叠)。

我们进一步发现,66% 的正确解决问题至少包含一个在一致替换下对直接证明树依赖性不敏感的对齐步骤——所有这些都涉及实体引入前提,这是一致替换评估器的一个已记录盲点——这是一个“正确答案,错误推理”的信号,对被动方法来说是不可见的。所有审计证书、原始输出和重现脚本都可以在公共 GitHub 存储库中获取,我们还讨论了超出正式、可解析基准的范围限制。

博主点评: 本文通过干预式基础审计方法揭示了大型语言模型在推理过程中的潜在盲点,尤其是在处理复杂推理时的前提依赖性。该方法的创新性在于能够有效检测到“正确答案但错误推理”的情况,推动了对语言模型推理能力的更深入理解。审计结果将为未来的模型改进提供重要参考。

原文链接: https://arxiv.org/abs/2607.13069

[h] 返回首页