现代 AI 图像生成器常以不透明的 API 形式提供,用户只能发送查询,却无法查看模型权重或结构。这导致一个实际风险:服务提供商在通过治理认证后,可能暗中切换到成本更低、质量更差的生成器,从而危害公众信任,甚至在高风险领域威胁安全。
为了解决部署阶段的完整性审计问题,本文提出 FARE(Forensic Acceptance Region Estimation)。在认证阶段,先对已认证的生成器采样大量图像,并用这些图像训练 FARE,形成该生成器的“接受区”。部署后,FARE 仅凭单张生成图像即可判断其是否与注册的生成器一致。
FARE 的特征来源于已有取证研究中发现的生成器特有伪影。训练过程中,FARE 会主动寻找“硬样本”,即那些最能逼近接受区边界的图像,从而收紧接受区并提升对细微模型变化的敏感度。
实验覆盖多种生成器替换场景,包括相似版本之间的切换和不同模型变体的替换。结果表明,FARE 能稳健检测出模型替换,在严格的操作点上始终优于现有基线,并且在本文评估的精确模型攻击和仅决策攻击下仍保持有效。
点评