被动图像溯源关注仅凭像素能否判断图像来源:是人类、某类 AI 还是特定生成模型。若源图在验证前被编辑,这一任务转化为在对抗分布漂移下的源‑目标验证问题。我们首先给出任意仅使用像素的验证器的最佳极限:最大全局鲁棒目标接受差等于目标分布与所有可能被攻击的源分布集合之间的最小全变差距离 $d_{\text{TV}}$。该量仅由源、目标以及编辑类决定,与验证器的网络结构无关。随后我们解释为何实际部署的公开验证器往往在达到该统计极限前就失效。若验证器在攻击区域的误差上界为 $\varepsilon$,则黑箱代理攻击能够在 $2\varepsilon$ 加上白箱最优解的优化误差内实现目标接受。公开特征上的得分揭示的 logistic 与 softmax 头是可辨识的,近似得分访问还能提供稳定的恢复界限。我们在有限状态实验中检验了可计算的极小极大等式。实验证明,在同一提示的真实/扩散基准上,公开的 CLIP 验证器在针对像素的定向攻击下失效,而 ResNet‑18 受害模型表现出部分假‑真转移。二元反馈加上弃权可以降低攻击成功率的测量,但正向经验上界并不能证明鲁棒性。这些发现表明,需要分别评估源‑目标的统计上限和已部署验证器泄露的信息。
点评:本文将被动溯源抽象为统计极限问题,给出明确的全变差界限并揭示实际系统的实现缺陷,为后续设计可验证的图像来源判别器提供了理论与实验依据。