NeFut Logo NeFut
EN 管理员登录

[AI学术] 决策转移、标签功能丢失与不确定的基于正确性的多教师蒸馏审计

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #LLM

本文评估了在固定实验设置下的正确性门控多教师蒸馏。实验包含 8 条臂,共用 4,330 条来源数据,使用 63.9M 参数的学生模型,进行 12,990 行优化、406 次更新,并提供证据输入和解码器。七条基于教师的臂使用固定的三响应池,三组随机种子在 267 条保留样本上评估。

相较于未过滤的蒸馏,正确性加权臂的准确率提升 $+0.1660$(95% 观测区间 $[0.0670, 0.2455]$),宏观 F1 提升 $+0.1323$($[0.0916, 0.1731]$),任务定义的条件不安全行为率下降 $-0.4979$($[-0.5926, -0.3686]$)。这些变化并不意味着整体行为更好。源标签 SFT 的平均宏观 F1 最高,为 $0.586$。加权臂在所有种子中 Refuted 召回率为零,且有两组种子对全部 167 条声明样本标记为 NotEnoughInfo。

在一次可用性修正审计中,对一个参考种子进行比较,加权臂与未过滤输出的证据支持阳性分别为 $0/20$ 与 $1/20$,包含未支持材料的阳性分别为 $20/20$ 与 $19/20$。样本非配对、来源重叠未序列化,修正在自动摘要后、标注前完成,导致审计无法估计共同来源的 grounding 效果,因而对系统层面的改进或危害无法得出结论。

硬过滤已实现 $0.660$ 的准确率、$0.530$ 的宏观 F1 和 $0.135$ 的条件不安全率。实现的加权臂未展示出相对于硬过滤的增量决策收益。固定矩阵失效分析表明决策被重新分配且标签功能丢失,现有人工审计未能确认 grounding 增益。

点评

原文链接: https://arxiv.org/abs/2609.09702

[h] 返回首页