在机器学习模型的安全部署中,可靠的分布外样本(OOD)检测至关重要。神经网络在面对偏离训练数据的输入时,往往会产生过于自信的预测,导致性能显著下降。许多 OOD 检测方法集中在输出层,忽视了中间网络层中丰富的层次信息。
本文提出了一种新颖的方法,利用稀疏自编码器(SAE)从这些中间激活中学习可解释的特征。我们发现,分布内(ID)和分布外(OOD)数据激活了不同的稀疏特征集合。我们提出了一种新的 OOD 评分,基于测试样本的稀疏特征激活与 ID 类的平均激活之间的余弦相似度。
我们的后处理检测方法不仅在标准 OOD 检测基准上达到了最先进的性能,还提供了关于分布变化如何影响学习表示的可解释见解。
博主点评: 该研究通过引入稀疏自编码器,突破了传统 OOD 检测方法的局限,不仅提升了检测性能,更为模型的可解释性提供了新的视角。这对于安全敏感的应用场景具有重要意义,值得深入探讨与实践。