NeFut Logo NeFut
EN 管理员登录

[AI学术] 从可信到可操作:关于大语言模型自我解释的立场

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#Machine Learning #LLM #Artificial Intelligence

大语言模型(LLM)能够生成自然语言解释,阐述自身决策,这被称为自我解释。

自我解释在可解释人工智能(XAI)中被视为有前景的方向,尤其用于理解 LLM 的行为。

然而,这类解释往往看起来很合理,却不一定忠实反映模型内部的推理过程,这一点仍未得到证实。

本文立场是:自我解释可以高度可信、可信度存疑,却仍具高度可操作性。

从传统 XAI 视角出发,本文指出当前评估 LLM 生成自我解释的标准协议存在局限,包括过度依赖人工主观判断和缺乏对推理路径的检验。

为此,提出实用的评估指南:① 通过对比模型输出与解释的一致性来衡量可信度;② 使用对抗样本或因果干预检验解释的忠实度。

更进一步,评估应超越可信度和忠实度,关注可操作性,即解释能否帮助不同利益相关者做出明智决策并采取恰当行动。

文中列举了若干应用场景,如辅助医学诊断、法律文书审查和业务决策支持,展示了利用 LLM 合理化能力实现实际行动的可能性。

综上,作者呼吁研究者在设计评估框架时兼顾可信、忠实和可操作三维度,以推动自我解释在真实系统中的落地。

点评

原文链接: https://arxiv.org/abs/2607.15957

[h] 返回首页