在医疗诊断、信用审批和能源竞标等高风险领域,神经网络的决策日益重要。这些场景下的审计需要案例级证据:哪些训练案例支持某项行动,以及它们的结果。基于案例的决策理论(CBDT)通过聚合记忆案例的结果支持来形式化这种推理。
我们展示了一个在固定神经表示上拟合的OLS动作读出,允许精确的案例分解。每个动作得分是训练案例回报的加权和,其系数由经验Gram几何确定。我们识别了CBDT相似性语义的充分区域;在此之外,系数通常应视为带符号的Gram几何影响。
该分解生成的审计信号可以追踪得分至训练案例,衡量行动一致性,并识别弱支持。在合成CBDT、PJM、成人收入和违约信用任务中,该方法恢复了案例级偏好结构,并在比较的归因基线中实现了最高的均值Top-30一致性,同时在支持重建上保持竞争力。
审计仅需拟合一个OLS顶层探针,无需重新训练表示或访问原始优化轨迹;探针的保真度通过得分重建来衡量。
博主点评: 本文通过基于案例的决策理论为神经网络的决策提供了清晰的审计路径,尤其在高风险应用中具有重要意义。其方法不仅提升了决策透明度,还通过简单的OLS探针实现了有效的支持重建,值得在实际应用中推广。