NeFut Logo NeFut
EN 管理员登录

[AI学术] 基于删除的测试时提升大语言模型解释可信度的方法

发布于:2026-09-07 22:00 最后更新:2026-09-08 00:37
#AI #Machine Learning #LLM

大型语言模型(LLM)在关键决策中的使用日益增多,模型给出的答案与解释成为审计其行为的重要依据。然而,解释往往不忠实,无法真实反映模型的推理过程。我们把不忠实的解释划分为两个维度:不完整性——解释遗漏了影响答案的因素;不可靠性——解释引用了并未影响模型答案的因素。现有提升忠实度的方法主要分为两类:训练时方法需要访问模型权重并消耗大量算力;测试时方法大多只针对不可靠性进行校正。本文提出一种直接针对不完整性的测试时策略:在输入中删除解释未提及的概念,然后重新查询模型得到答案。该操作保留了解释中已列出的因素的影响,同时剔除隐藏的、未被说明的因素。我们在两个数据集、多个模型族以及两套独立的忠实度评估指标上进行实验,结果显示该方法相较于普通提示和旨在提升忠实度的提示均有显著提升。该方法不依赖特定模型,推理阶段即可使用,无需修改模型参数,为降低隐藏影响、提升 LLM 辅助决策的可靠性与安全性提供了一种灵活机制。

点评

原文链接: https://arxiv.org/abs/2609.04343

[h] 返回首页