NeFut Logo NeFut
EN 管理员登录

[AI学术] 因果归因于代理决策:估计器、耦合与可追溯性规范

发布于:2026-09-10 22:00 最后更新:2026-09-12 06:35
#algorithm #AI #Machine Learning

高风险 AI 系统的提供者必须保存能够追溯决策的记录,但对于具备自主性的系统,尚未明确这些记录应包含哪些信息以实现事后因果归因。本文首先提出估计器框架,并阐明其失效的条件。我们将先前工作测量的边际总效应($TE_{marg}$)与一种使用公共随机数的总效应($TE_{crn}$)区分开来,后者能够隔离单一步骤自身的贡献。进一步在下游固定的情形下加入自然直接效应($NDE$),并将估计器与手工推导结果对照检验。两种估计量均出现相同方向的失效。对于边际估计量而言,一个因果惰性的步骤在我们构造的链式实验中对每一次运行都表现出与决定性步骤相同的总效应,这是一条代数恒等式而非偶然抽样结果。对于公共随机数估计量,决定性步骤在执行步骤翻转的约十分之一的运行中恰好返回零,而此时其直接效应为 0.25 并且能够被观察到;零值并不意味着该步骤未产生作用,这一点我们在此而非局限性章节中指出。我们推导出一种耦合方法,使得在上下文分歧后仍能估计直接效应,并给出其退化的闭式表达式。实验表明,基于自然排名构建的中介份额在抑制情形下并非真正的份额:当直接路径与中介路径相反时,该份额会超过一,并把被抑制的组件排在纯中介组件之上。由于所需的实时流水线在研究窗口内不可用,我们仅公开了差异实验的预注册而非结果。最后,我们提出了可追溯性规范,以填补《人工智能法》日程留下的空白:第 86 条关于解释权自 2026 年 8 月 2 日起生效,而第 12 条日志记录和附件 IV 文档的实施被推迟至 2027 年 12 月 2 日(欧盟条例 2026/1744)。

点评 本研究揭示了现有因果归因估计器在代理系统中的局限,并提出了耦合方法与可追溯性规范,为监管合规提供了技术参考。

原文链接: https://arxiv.org/abs/2609.06445

[h] 返回首页