人工智能系统正越来越多地承担关键决策——判断患者是否恶化、建筑是否安全、图像是否真实等,用户往往依据模型的预测准确性和置信度来信任它们。为此,现有的安全措施几乎全部基于预测层面的认证:准确率、校准度以及符合性覆盖等指标都在衡量模型的预测表现。然而,这些指标是否足以保证模型的可信度一直是未解之谜。
本文证明,仅凭预测认证无法确保模型可信。我们给出一个分离定理:在所有预测侧证书(包括准确率、校准度和覆盖率)完全相同的情况下,仍可以构造出一个可靠模型和一个被破坏的模型,它们在解释忠实度和实际部署行为上可以任意不同。换言之,单纯检查预测结果无法发现某些潜在的失效。
要检测此类失效,必须同时获取模型的决策机制信息,而不仅是其输出。基于此,我们提出“能力边界”(competence envelope)框架,将预测认证与解释认证统一为可部署的判定标准。该框架在多种数据集和模型类别上实验表明,能够揭示仅靠预测认证无法捕获的失效模式。
因此,要对那些在预测行为上不可见的失效进行认证,必须同时提供模型决策过程的证据以及输出结果的证书。
博主点评:本文通过严谨的分离定理和实证验证,提醒我们在构建可信 AI 时不能只盯着预测指标,而要把解释可解释性纳入认证体系,能力边界提供了一个实用的操作框架。