分类器的条件准确率可以在置信分布保持完全不变的情况下发生变化。我们研究在保持置信分数分布不变的协变量漂移下,可靠性关系的最坏情况移动,并在每个置信水平内部通过 $\chi^2$ 预算约束重加权的幅度。
在一个可以从源分布计算得到的预算区间内,最坏情况恰好等于预算的平方根乘以正确性倾向的层内方差——即校准‑细化分解中的 grouping‑loss 项。超出该区间后,曲线受倾向分布尾部的支配,整个上升曲线决定了中心层内的倾向分布;因此校准残差和分组方差并不能一般决定脆弱性,除非标签和预测是确定性的。
由于倾向不可直接观测,我们将重加权限制在置信箱内学习得到的有限读出上,并用仍留在读出单元内的分组方差上界限制未捕获的部分。利用角色分离的标签估计受限的脆弱性曲线,并提供一个独立的拆分样本下界。
实验在 ImageNet 上进行。对四个主分类器中的六个以及额外发布的十二个中的九个,两个拆分均得到正的下界;在经过温度标定后,十八个分类器中有三个仍保持正值。优化的重加权在未使用评估标签的情况下,其持出漂移与估计的脆弱性曲线吻合;标签置换诊断显示该统计量的相关性几乎为零,而对无符号随机重加权则基本保持原相关性。
结论是,可靠性漂移的脆弱性可以用预算的平方根乘以层内方差来描述,并且在实际模型上可通过有限读出和拆分下界进行可靠估计。
点评