图像去模糊在计算机视觉中至关重要,旨在从因运动或相机抖动造成的模糊图像中恢复清晰图像。尽管深度学习方法如卷积神经网络(CNN)和视觉变换器(ViT)在这一领域取得了进展,但它们在处理复杂或高分辨率的模糊及计算需求时常常面临挑战。
为此,我们提出了一种新的双域架构,将视觉变换器与频域FFT-ReLU模块结合,明确地桥接了空间注意力建模与频率稀疏性。在该结构中,ViT主干网络捕捉局部和全局依赖关系,而FFT-ReLU组件则在频域上强制实施稀疏性,从而抑制模糊相关的伪影并保留细节。
在基准数据集上的大量实验表明,该架构在峰值信噪比(PSNR)、结构相似性指数(SSIM)和感知质量等方面优于现有的最先进模型。定量指标、定性比较以及人类偏好评估均确认了其有效性,为现实世界的图像恢复建立了一个实用且可泛化的范式。
博主点评: 该研究通过结合空间和频域的特性,为图像去模糊提供了新思路,尤其在处理高复杂度模糊时展现了显著优势,值得关注其在实际应用中的潜力。