# 基于对比正则化的高效频域图像去雨算法 ## 基本信息 - **论文标题**:Efficient Frequency-Domain Image Deraining with Contrastive Regularization - **作者**:Ning Gao, Xingyu Jiang, Xiuhui Zhang, Yue Deng - **机构**:School of Astronautics, Beihang University, Beijing, China - **发表会议**:ECCV 2024(European Conference on Computer Vision) - **学术影响力评估**:ECCV 是计算机视觉领域的顶级会议,对标CCF-B类会议,具有高学术影响力。作者所在机构(北京航空航天大学)在航空航天视觉计算领域具有强大实力,其AI实验室在图像恢复任务中多次发表高水平成果(如TPAMI、CVPR论文)。 - **开源代码**:https://github.com/deng-ai-lab/FADformer ## 文献的概述 1. **研究问题**:单幅图像去雨(Single Image Deraining, SID),属于低级视觉中的图像恢复任务,旨在从雨图中恢复清晰背景。 2. **技术目标**:解决现有Transformer方法在空间域全局建模中的高计算代价问题,并提升对负样本雨纹信息的利用效率。 3. **核心技术方案**:提出频域感知去雨Transformer框架(FADformer),核心包括: - **Fused Fourier Convolution Mixer (FFCM)**:在空间域和频率域并行卷积,实现高效全局-局部特征融合。 - **Prior-Gated Feed-forward Network (PGFN)**:引入残差信道先验(RCP)作为门控信号,增强结构保持能力。 - **Frequency-domain Contrastive Regularization (FCR)**:在频域进行对比学习,利用负样本雨纹模式提升泛化性。 ## 文献的概念 1. **核心术语**: - **快速傅里叶变换(Fast Fourier Transform, FFT)**:将图像从空间域转换到频率域的数学工具,用于提取全局特征。 - **残差信道先验(Residue Channel Prior, RCP)**:基于图像通道方差的结构性先验,无需学习即可增强细节恢复。 - **对比正则化(Contrastive Regularization)**:通过拉近正样本(清晰图像)、推远负样本(雨图)的频域特征,提升模型判别力。 2. **逻辑关系**:FFCM通过FFT在频域捕获雨纹的全局模式,PGFN利用RCP在空间域细化局部结构,FCR则通过频域对比学习约束优化方向,三者形成互补。 ## 文献的理论基础 1. **理论框架**:基于Transformer的编码器-解码器结构,但用频域操作替代自注意力机制,降低计算复杂度。 2. **现有局限性**: - 空间域自注意力(如Vision Transformer)计算成本高(O(n²)),且难以平衡效率与性能。 - 传统对比学习(如VGG编码)忽略雨纹的频域特性,导致泛化能力不足。 3. **改进思路**: - 利用频域中雨纹与背景的可分离性(见图2),通过FFT实现高效全局建模。 - 将任务先验(RCP)以门控方式嵌入前馈网络,引导局部修复。 4. **创新点关联**:将频域理论(卷积定理)与对比学习结合,形成轻量化的全局-局部融合范式。 ![descript](../../../_resources/image1-4.png) ## 文献的实验方法 ### 3.1 数据集描述 - **合成数据集**:Rain200L/H(1800训练/200测试,不同雨密度)、DDN-Data(12600训练/1400测试)、DID-Data(12000训练/1200测试)。 - **真实数据集**:SPA-Data(638492训练/1000测试)、Internet-Data(147无标签)、RE-RAIN(300无标签)。 - **预处理**:随机裁剪256×256 patches,增强包括旋转和翻转。 ### 3.2 基线模型选择 覆盖传统方法(DSC、GMM)到CNN(DDN、RESCAN)及Transformer(Uformer、Restormer、DRSformer),确保对比全面性。 ### 3.3 评估指标 - **有参考指标**:PSNR(峰值信噪比)、SSIM(结构相似性),计算于YCbCr空间的Y通道。 - **无参考指标**:BRISQUE、NIQE、SSEQ,用于真实数据评估。 - **计算效率**:参数量(**Param**)和FLOPs(浮点运算数)。 ## 文献的结论 1. **对比实验结果**: - 在Rain200L上,FADformer的PSNR达41.80 dB,比最优DRSformer提升0.57 dB,参数量仅20%(6.96M vs 33.70M),FLOPs降低80%(48.51G vs 242.9G)。 - 在真实数据SPA-Data上首次突破49 dB PSNR(49.21 dB),证明强泛化能力。 2. **技术优势**: - FFCM通过频域卷积实现等效全局感知,计算成本仅为自注意力的1/5。 - FCR在Rain200H上提升PSNR 0.48 dB(见表7),且通用性强(见表8)。 3. **消融实验验证**: - 移除FFCM的频域操作导致PSNR下降1.3 dB(表3);替换为自注意力需增加深度才能达到相近性能(表4)。 - PGFN比标准FFN提升PSNR 0.39 dB,证明先验门控的有效性(表5)。 ![descript](../../../_resources/image2-4.png) ## 个人思考和总结 ### 技术贡献 1. **算法创新**:首次将频域卷积与对比正则化结合,为图像恢复任务提供了轻量化全局建模新范式。 2. **工程价值**:FADformer在保持SOTA性能的同时,参数量降低至主流Transformer的20%,适合实时应用(如自动驾驶)。 ### 技术局限性 1. **频域假设依赖**:FFCM依赖于雨纹在频域的可分离性,对非周期噪声(如运动模糊)效果可能受限。 2. **真实数据偏差**:虽在SPA-Data表现优异,但复杂自然场景(如暴雨+雾霾)的泛化性需进一步验证。 ### 医学图像分割适用场景分析 尽管此论文聚焦去雨任务,但其核心技术对医学图像分割具有潜在价值: 1. **频域特征提取**:医学图像(如MRI、CT)中的病灶区域常表现为频域高频分量(如肿瘤边缘),FFCM可高效捕获全局解剖结构,避免传统CNN的局部感受野限制。 2. **对比正则化适配**:FCR模块可迁移至医学分割中的异常检测,例如将健康组织作为正样本、病变组织作为负样本,在频域构建对比损失,增强模型对微小病变的敏感性。 3. **轻量化优势**:医学影像数据量大,FADformer的低计算成本适合临床实时处理。 **改进想法**: - 结合2024年医学分割趋势(例如 nnUNet框架),将FFCM替换自注意力模块。 - **动态频域选择**:借鉴2024年CVPR工作(如Dynamic FFT),引入可学习的频带滤波器,适配不同医学模态的频谱特性。 - **多模态对比学习**:将FCR扩展至多模态数据(如PET-CT),利用频域特征对齐提升融合分割精度。 ![descript](../../../_resources/image3-2.png)