现代视觉 Transformer 的路由信号——专家门、注意力‑残差权重和停机分数——常被用于训练探针,以预测模型是否正确。人们通常把探针性能的提升解释为路由携带了模型输出之外的错误信息。我们直接检验这一推断:在保持真实的输出‑路由配对的前提下,从一个在不相交数据上拟合的仅输出生成器重新抽取正确性标签,使得路由在构造上不含信息。
在严格的零标签假设下,宽度匹配的 MLP 与仅置信度的基线比较仍在 51.3%(308/600)的评估中报告路由增益,而线性比较则没有检测到增益。固定每条训练轨迹并改用验证对数损失而非验证准确率选取检查点后,检测率从 50/120 降至 0/120,独立实现的探针从 83/120 降至 0/120,表明基于准确率的检查点选择是导致虚假检测的根源;在所有输出视图上,原始检测率从 27.5%(528/1920)跌至零。
修正后的比较对微弱信号的灵敏度极低:在两组匹配设置中,植入约 $$0.005\ \text{nats}$$ 的信号在 0/20 次复制中被检测到,而基于估计路由律的条件置换检验在 11/20 与 10/20 次复制中检测到该信号,并且在零假设下很少被拒绝。
在真实正确性标签上,条件分析在五个 DeiT 注意力‑残差族中提供了相对模型证据;其中四个族在两种指定的条件律变体下仍保持显著,但没有族满足额外的噪声标准。
更好的探针拟合与增量信息检验是不同的问题,各自需要独立的验证。
点评