NeFut Logo NeFut
EN 管理员登录

[AI学术] 从训练到部署:后 hoc 因果特征识别的新方法

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#algorithm #Machine Learning #C++

在一个已经训练好的模型中,如何区分依赖于因果特征与虚假特征的变量?现有方法需访问训练过程,无法进行后 hoc 分析。我们提出了 \textbf{标准化敏感性比率~(NSR)},这是一种后 hoc、模型无关的诊断工具,适用于结构性转变的环境:这些环境的主要差异在于虚假特征的均值,而因果机制和因果边际保持稳定,类似于多站点临床数据或多批次基因组数据。在这种情况下,因果特征在不同环境下会诱导模型敏感性的一致性,而虚假特征则会随转变而变化。NSR 将这一现象形式化为每个环境敏感性的平方变异系数。根据线性结构因果模型 (SCM) 的理论,当有 $K \ge 3$ 个非退化环境时,NSR 可以实现精确识别(定理 1)。我们充分描述了失败的情况:弱转变 ($O(\varepsilon^4)$ 崩溃)、退化几何和代理衰减 ($O((1-\alpha)^4)$),为从业者提供了评估该环境是否成立的量化标准。在零假设下,有限样本率为 $O_p(n^{-1})$,在备择假设下为 $O_p(n^{-1/2})$。实验结果验证了所有理论预测,在合适的条件下,合成数据的 ROC 曲线下面积 [AUROC] 达到 $1.000$,在五个模型族中显示一致的排名 (Kendall $\tau \ge 0.529$),并在共享单车数据中恢复了八个因果特征中的六个 (Precision@7 $= 0.75$),且未修改任何训练好的模型。

博主点评: 本文提出的 NSR 方法为后 hoc 因果特征识别提供了强有力的工具,尤其适用于多环境数据分析。通过理论与实验结果相结合,展示了该方法在实际应用中的有效性,具有广泛的应用前景。

原文链接: https://arxiv.org/abs/2607.25546

[h] 返回首页