NeFut Logo NeFut
EN 管理员登录

[AI学术] Swin 与 EfficientNet 的结合:轻量级 GAN 人脸取证模型

发布于:2026-09-04 22:00 最后更新:2026-09-05 12:23
#AI #Machine Learning #Neural

现代生成模型(如 GAN、扩散模型和自回归系统)已经能够生成几乎与真实照片无差别的人脸图像,这使得伪造图像的检测变得异常困难,进而引发身份盗用、欺诈和信息误导等安全隐患。本文聚焦于 GAN 生成的合成脸,探讨仅凭图像分析即可实现的高效检测方法。现有检测体系主要依赖卷积神经网络(CNN)或全局视觉 Transformer(ViT)。CNN 擅长捕捉纹理层面的局部特征,却在全局语义建模上受限;ViT 能够捕获长程结构信息,但计算开销大。为此我们在 Swin‑Transformer 基础上实现了三种方案:

  1. 从零训练的紧凑型 Swin;
  2. 基于 ImageNet‑1K 预训练的 Swin‑Tiny 与 Swin‑Small,针对二分类任务进行微调;
  3. 将 EfficientNet‑B0 的卷积特征提取与 Swin 的窗口自注意力相结合的混合架构。

所有模型均在 14 万张真实与伪造人脸数据集上进行评估,数据集包含 StyleGAN 生成的假脸、Flickr 与 DFDC 的真实图像,且训练、验证、测试划分均衡。混合模型 EfficientNet‑B0+Swin 在 5 000 张测试图像上取得 99% 的准确率和 99.44% 的召回率,优于纯 Swin 变体以及此前的仅 CNN 基线。实验表明,层次化的卷积特征与移位窗口自注意力的结合能够在保持轻量级计算的前提下,实现对 GAN 合成脸的高效检测。

点评:该工作展示了跨模态特征融合的潜力,为资源受限环境下的深度伪造检测提供了实用路径。

原文链接: https://arxiv.org/abs/2609.01749

[h] 返回首页