NeFut Logo NeFut
EN 管理员登录

[AI学术] 通过论证分析衡量 AI 责任:模型推理能经受审查吗?

发布于:2026-09-08 22:00 最后更新:2026-09-09 09:08
#AI #Machine Learning #LLM

AI 监督方法通常依赖于真实答案来验证模型,但何为恰当的 AI 行为本身就存在争议,这导致对大语言模型(LLM)道德推理的评估往往回避真实的模糊情境。为了解决这一问题,我们提出一种在模糊环境下仍可运行的标准:模型对其判决的防御质量。该防御通过四阶段辩证协议进行测量,协议基于 Walton 的论证模式理论和 Govier 的论证可信度标准。协议能够适配不同的推理框架,超越传统的多选题形式,同时考察判决前的推理过程和事后解释。我们在九个前沿模型上进行实验,使用 200 条高模糊度的 MoralChoice 项目,共计 6,778 条由评审打分的单元格,二元失败判断的评审间一致率达到 89.6%。结果显示,各模型在所有维度上均显著高于评分标准的最低要求。失败主要集中在论据的依据和充分性上,并且与模型的认知保留(epistemic hedging)相关,而非论证长度。模型对推理过程的防御普遍优于对事后解释的防御,且在每个模型和 Govier 的每个维度上均呈现此趋势。值得注意的是,模型在解释中使用的论证模式与其实际推理时采用的模式在不少情境(≥20%)下不一致,尽管价值导向的实用推理在两者中均占主导。协议能够捕捉到完全不可辩护的防御(如自相矛盾、前提错误),并揭示了在 AI 对齐中撤回(retraction)角色的表征困难,提示需要更具情境性的评估方法。

点评

原文链接: https://arxiv.org/abs/2609.05088

[h] 返回首页