论文标题:Efficient Frequency-Domain Image Deraining with Contrastive Regularization
作者:Ning Gao, Xingyu Jiang, Xiuhui Zhang, Yue Deng
机构:School of Astronautics, Beihang University, Beijing, China
发表会议:ECCV 2024(European Conference on Computer Vision)
学术影响力评估:ECCV 是计算机视觉领域的顶级会议,对标CCF-B类会议,具有高学术影响力。作者所在机构(北京航空航天大学)在航空航天视觉计算领域具有强大实力,其AI实验室在图像恢复任务中多次发表高水平成果(如TPAMI、CVPR论文)。
研究问题:单幅图像去雨(Single Image Deraining, SID),属于低级视觉中的图像恢复任务,旨在从雨图中恢复清晰背景。
技术目标:解决现有Transformer方法在空间域全局建模中的高计算代价问题,并提升对负样本雨纹信息的利用效率。
核心技术方案:提出频域感知去雨Transformer框架(FADformer),核心包括:
Fused Fourier Convolution Mixer (FFCM):在空间域和频率域并行卷积,实现高效全局-局部特征融合。
Prior-Gated Feed-forward Network (PGFN):引入残差信道先验(RCP)作为门控信号,增强结构保持能力。
Frequency-domain Contrastive Regularization (FCR):在频域进行对比学习,利用负样本雨纹模式提升泛化性。
快速傅里叶变换(Fast Fourier Transform, FFT):将图像从空间域转换到频率域的数学工具,用于提取全局特征。
残差信道先验(Residue Channel Prior, RCP):基于图像通道方差的结构性先验,无需学习即可增强细节恢复。
对比正则化(Contrastive Regularization):通过拉近正样本(清晰图像)、推远负样本(雨图)的频域特征,提升模型判别力。
理论框架:基于Transformer的编码器-解码器结构,但用频域操作替代自注意力机制,降低计算复杂度。
现有局限性:
空间域自注意力(如Vision Transformer)计算成本高(O(n²)),且难以平衡效率与性能。
传统对比学习(如VGG编码)忽略雨纹的频域特性,导致泛化能力不足。
利用频域中雨纹与背景的可分离性(见图2),通过FFT实现高效全局建模。
将任务先验(RCP)以门控方式嵌入前馈网络,引导局部修复。
合成数据集:Rain200L/H(1800训练/200测试,不同雨密度)、DDN-Data(12600训练/1400测试)、DID-Data(12000训练/1200测试)。
真实数据集:SPA-Data(638492训练/1000测试)、Internet-Data(147无标签)、RE-RAIN(300无标签)。
预处理:随机裁剪256×256 patches,增强包括旋转和翻转。
覆盖传统方法(DSC、GMM)到CNN(DDN、RESCAN)及Transformer(Uformer、Restormer、DRSformer),确保对比全面性。
有参考指标:PSNR(峰值信噪比)、SSIM(结构相似性),计算于YCbCr空间的Y通道。
无参考指标:BRISQUE、NIQE、SSEQ,用于真实数据评估。
计算效率:参数量(Param)和FLOPs(浮点运算数)。
在Rain200L上,FADformer的PSNR达41.80 dB,比最优DRSformer提升0.57 dB,参数量仅20%(6.96M vs 33.70M),FLOPs降低80%(48.51G vs 242.9G)。
在真实数据SPA-Data上首次突破49 dB PSNR(49.21 dB),证明强泛化能力。
FFCM通过频域卷积实现等效全局感知,计算成本仅为自注意力的1/5。
FCR在Rain200H上提升PSNR 0.48 dB(见表7),且通用性强(见表8)。
移除FFCM的频域操作导致PSNR下降1.3 dB(表3);替换为自注意力需增加深度才能达到相近性能(表4)。
PGFN比标准FFN提升PSNR 0.39 dB,证明先验门控的有效性(表5)。
算法创新:首次将频域卷积与对比正则化结合,为图像恢复任务提供了轻量化全局建模新范式。
工程价值:FADformer在保持SOTA性能的同时,参数量降低至主流Transformer的20%,适合实时应用(如自动驾驶)。
频域假设依赖:FFCM依赖于雨纹在频域的可分离性,对非周期噪声(如运动模糊)效果可能受限。
真实数据偏差:虽在SPA-Data表现优异,但复杂自然场景(如暴雨+雾霾)的泛化性需进一步验证。
尽管此论文聚焦去雨任务,但其核心技术对医学图像分割具有潜在价值:
频域特征提取:医学图像(如MRI、CT)中的病灶区域常表现为频域高频分量(如肿瘤边缘),FFCM可高效捕获全局解剖结构,避免传统CNN的局部感受野限制。
对比正则化适配:FCR模块可迁移至医学分割中的异常检测,例如将健康组织作为正样本、病变组织作为负样本,在频域构建对比损失,增强模型对微小病变的敏感性。
轻量化优势:医学影像数据量大,FADformer的低计算成本适合临床实时处理。
改进想法:
结合2024年医学分割趋势(例如 nnUNet框架),将FFCM替换自注意力模块。
动态频域选择:借鉴2024年CVPR工作(如Dynamic FFT),引入可学习的频带滤波器,适配不同医学模态的频谱特性。
多模态对比学习:将FCR扩展至多模态数据(如PET-CT),利用频域特征对齐提升融合分割精度。