每个生产模型都会因重新训练、微调、量化或供应商替换而更新,而每次更新都可能导致性能退化。我们将模型更新的推广形式化为配对风险差异审计。
关键观察是支持身份:两个模型的风险差异只出现在它们预测不一致的输入上,这部分可以在没有标签的情况下直接观测到。
基于此我们提出 DISCERN,一种两层顺序协议。第一层是零标签层,仅利用未标记流量检测不一致率是否低于容忍阈值,从而在无需任何标签的情况下认证良性更新。第二层是审计层,对抽样得到的不一致样本进行标注,并通过随时有效的置信序列进行推断,该序列在任意停止时刻以及任意标签路由规则(即使是对抗性裁判)下都保持有效。
我们证明了有限样本下的有效性,并给出匹配的标签复杂度上界 $O(\rho^2/\varepsilon^2)$,这表明利用免费不一致信息可以比任何不考虑配对信息的审计器节省约 $1/\rho$ 的标签量。该保证还能在单一错误预算下对无限序列的模型推广进行组合使用。
在超过 14,000 条重放审计流、785 对模型更新(包括参数量最高 1.4B 的 LoRA 微调)上实验表明:实际误覆盖率为 0.0002(标称 5%),检测功效 0.986,且没有误报;56% 的良性更新在零标签层即获认证。
每一次审计都会生成机器可检查的证据记录,便于后市场监控。
点评