1.Efficient Frequency-Domain Image Deraining with .md 6.6 KB

基于对比正则化的高效频域图像去雨算法

基本信息

  • 论文标题:Efficient Frequency-Domain Image Deraining with Contrastive Regularization

  • 作者:Ning Gao, Xingyu Jiang, Xiuhui Zhang, Yue Deng

  • 机构:School of Astronautics, Beihang University, Beijing, China

  • 发表会议:ECCV 2024(European Conference on Computer Vision)

  • 学术影响力评估:ECCV 是计算机视觉领域的顶级会议,对标CCF-B类会议,具有高学术影响力。作者所在机构(北京航空航天大学)在航空航天视觉计算领域具有强大实力,其AI实验室在图像恢复任务中多次发表高水平成果(如TPAMI、CVPR论文)。

  • 开源代码https://github.com/deng-ai-lab/FADformer

文献的概述

  1. 研究问题:单幅图像去雨(Single Image Deraining, SID),属于低级视觉中的图像恢复任务,旨在从雨图中恢复清晰背景。

  2. 技术目标:解决现有Transformer方法在空间域全局建模中的高计算代价问题,并提升对负样本雨纹信息的利用效率。

  3. 核心技术方案:提出频域感知去雨Transformer框架(FADformer),核心包括:

  • Fused Fourier Convolution Mixer (FFCM):在空间域和频率域并行卷积,实现高效全局-局部特征融合。

  • Prior-Gated Feed-forward Network (PGFN):引入残差信道先验(RCP)作为门控信号,增强结构保持能力。

  • Frequency-domain Contrastive Regularization (FCR):在频域进行对比学习,利用负样本雨纹模式提升泛化性。

文献的概念

  1. 核心术语
  • 快速傅里叶变换(Fast Fourier Transform, FFT):将图像从空间域转换到频率域的数学工具,用于提取全局特征。

  • 残差信道先验(Residue Channel Prior, RCP):基于图像通道方差的结构性先验,无需学习即可增强细节恢复。

  • 对比正则化(Contrastive Regularization):通过拉近正样本(清晰图像)、推远负样本(雨图)的频域特征,提升模型判别力。

  1. 逻辑关系:FFCM通过FFT在频域捕获雨纹的全局模式,PGFN利用RCP在空间域细化局部结构,FCR则通过频域对比学习约束优化方向,三者形成互补。

文献的理论基础

  1. 理论框架:基于Transformer的编码器-解码器结构,但用频域操作替代自注意力机制,降低计算复杂度。

  2. 现有局限性

  • 空间域自注意力(如Vision Transformer)计算成本高(O(n²)),且难以平衡效率与性能。

  • 传统对比学习(如VGG编码)忽略雨纹的频域特性,导致泛化能力不足。

  1. 改进思路
  • 利用频域中雨纹与背景的可分离性(见图2),通过FFT实现高效全局建模。

  • 将任务先验(RCP)以门控方式嵌入前馈网络,引导局部修复。

  1. 创新点关联:将频域理论(卷积定理)与对比学习结合,形成轻量化的全局-局部融合范式。

descript

文献的实验方法

3.1 数据集描述

  • 合成数据集:Rain200L/H(1800训练/200测试,不同雨密度)、DDN-Data(12600训练/1400测试)、DID-Data(12000训练/1200测试)。

  • 真实数据集:SPA-Data(638492训练/1000测试)、Internet-Data(147无标签)、RE-RAIN(300无标签)。

  • 预处理:随机裁剪256×256 patches,增强包括旋转和翻转。

3.2 基线模型选择

覆盖传统方法(DSC、GMM)到CNN(DDN、RESCAN)及Transformer(Uformer、Restormer、DRSformer),确保对比全面性。

3.3 评估指标

  • 有参考指标:PSNR(峰值信噪比)、SSIM(结构相似性),计算于YCbCr空间的Y通道。

  • 无参考指标:BRISQUE、NIQE、SSEQ,用于真实数据评估。

  • 计算效率:参数量(Param)和FLOPs(浮点运算数)。

文献的结论

  1. 对比实验结果
  • 在Rain200L上,FADformer的PSNR达41.80 dB,比最优DRSformer提升0.57 dB,参数量仅20%(6.96M vs 33.70M),FLOPs降低80%(48.51G vs 242.9G)。

  • 在真实数据SPA-Data上首次突破49 dB PSNR(49.21 dB),证明强泛化能力。

  1. 技术优势
  • FFCM通过频域卷积实现等效全局感知,计算成本仅为自注意力的1/5。

  • FCR在Rain200H上提升PSNR 0.48 dB(见表7),且通用性强(见表8)。

  1. 消融实验验证
  • 移除FFCM的频域操作导致PSNR下降1.3 dB(表3);替换为自注意力需增加深度才能达到相近性能(表4)。

  • PGFN比标准FFN提升PSNR 0.39 dB,证明先验门控的有效性(表5)。

descript

个人思考和总结

技术贡献

  1. 算法创新:首次将频域卷积与对比正则化结合,为图像恢复任务提供了轻量化全局建模新范式。

  2. 工程价值:FADformer在保持SOTA性能的同时,参数量降低至主流Transformer的20%,适合实时应用(如自动驾驶)。

技术局限性

  1. 频域假设依赖:FFCM依赖于雨纹在频域的可分离性,对非周期噪声(如运动模糊)效果可能受限。

  2. 真实数据偏差:虽在SPA-Data表现优异,但复杂自然场景(如暴雨+雾霾)的泛化性需进一步验证。

医学图像分割适用场景分析

尽管此论文聚焦去雨任务,但其核心技术对医学图像分割具有潜在价值:

  1. 频域特征提取:医学图像(如MRI、CT)中的病灶区域常表现为频域高频分量(如肿瘤边缘),FFCM可高效捕获全局解剖结构,避免传统CNN的局部感受野限制。

  2. 对比正则化适配:FCR模块可迁移至医学分割中的异常检测,例如将健康组织作为正样本、病变组织作为负样本,在频域构建对比损失,增强模型对微小病变的敏感性。

  3. 轻量化优势:医学影像数据量大,FADformer的低计算成本适合临床实时处理。

改进想法

  • 结合2024年医学分割趋势(例如 nnUNet框架),将FFCM替换自注意力模块。

  • 动态频域选择:借鉴2024年CVPR工作(如Dynamic FFT),引入可学习的频带滤波器,适配不同医学模态的频谱特性。

  • 多模态对比学习:将FCR扩展至多模态数据(如PET-CT),利用频域特征对齐提升融合分割精度。

descript