输入特征图 $X \in \mathbb{R}^{B \times C \times H \times W}$ 首先经过 $J$ 层离散小波变换,分解为低频分量 $Y_L$ 和高频分量集合 $Y_H = {YH^{(i)}}{i=1}^J$:
$$ (Y_L, Y_H) = \text{DWT}(X) $$
其中,第 $i$ 层的高频分量 $Y_H^{(i)} \in \mathbb{R}^{B \times C \times 3 \times H_i \times W_i}$ 包含三个方向(水平、垂直、对角)的子带。
对于任意输入子带特征 $S$(无论是 $Y_L$ 还是 $Y_H^{(i)}$ 中的某个子带),通过 AWA 计算增强权重:
基础通道注意力 ($W_{base}$):
$$ W_{base} = \sigma(\text{Conv}_2(\delta(\text{Conv}_1(\text{GAP}(S))))) $$
其中 $\text{GAP}$ 为全局平均池化,$\delta$ 为 ReLU 激活,$\sigma$ 为 Sigmoid 激活,$\text{Conv}_1, \text{Conv}_2$ 为降维和升维的卷积操作。
融合门控因子 ($G$):
$$ G = \sigma(\text{Conv}'_2(\delta(\text{Conv}'_1(\text{GAP}(S))))) $$
结构与基础注意力相同,但参数独立。
动态增强因子 ($E$):
$$ E = 1 + (\beta \cdot G) $$
其中 $\beta$ 是可学习参数 bias_scale(低频初始化为 0.2,高频为 0.4)。
最终权重 ($W_{final}$):
$$ W{final} = \text{clamp}(W{base} \odot E, \min=0.1) $$
此处 $\odot$ 表示逐元素乘法,$\text{clamp}$ 确保权重下限为 0.1。
特征增强输出 ($S'$):
$$ S' = S \odot W_{final} $$
低频增强:
$$ Y'L = \text{Attention}{LL}(Y_L) $$
使用独立的注意力模块$\text{Attention}_{LL}$处理低频分量。
高频增强:
对于每一层 $i \in [1, J]$ 和每个方向 $j \in {0, 1, 2}$:
将增强后的低频分量 $Y'_L$ 和高频分量集合 $Y'_H = {Y'^{(i)}H}{i=1}^J$ 重构回原始空间:
$$ X' = \text{IDWT}(Y'_L, Y'_H) $$
最终输出 $X'$ 即为经过自适应小波子带增强后的特征图。
首先通过两个 $3 \times 3$ 卷积和一个激活函数提取局部特征:
$$ \mathbf{X}_{conv} = \text{Conv}_2(\text{LeakyReLU}(\text{Conv}_1(\mathbf{X}))) $$
其中 $\mathbf{X} \in \mathbb{R}^{B \times C \times H \times W}$ 为输入,$\mathbf{X}_{conv}$ 为卷积分支输出。
对 $\mathbf{X}_{conv}$ 进行全局平均池化,压缩空间维度:
$$ \mathbf{Z} = \text{GAP}(\mathbf{X}_{conv}) \in \mathbb{R}^{B \times C \times 1 \times 1} $$
利用两个独立的轻量级 CNN 分支分别学习幅度和相位的增强系数:
$$ \mathbf{M}a = f{\theta_a}(\mathbf{Z}), \quad \mathbf{M}p = f{\theta_p}(\mathbf{Z}) $$
其中 $f_{\theta}$ 代表代码中的 xc_aEnhance 和 xc_pEnhance 序列(Conv-ReLU-Conv)。
对池化特征 $\mathbf{Z}$ 沿通道维度 ($dim=1$) 进行快速傅里叶变换:
$$ \hat{\mathbf{Z}} = \text{FFT}(\mathbf{Z}, \text{dim}=1) $$
分解得到幅度谱 $\mathbf{A}$ 和相位谱 $\mathbf{P}$:
$$ \mathbf{A} = |\hat{\mathbf{Z}}|, \quad \mathbf{P} = \angle(\hat{\mathbf{Z}}) $$
将学习到的系数应用于幅度和相位,并重构复数信号:
增强操作:
$$ \tilde{\mathbf{A}} = \mathbf{A} \odot \mathbf{M}_a, \quad \tilde{\mathbf{P}} = \mathbf{P} \odot \mathbf{M}_p $$
($\odot$ 表示逐元素乘法)
复数重构:
$$ \hat{\mathbf{Z}}_{enh} = \tilde{\mathbf{A}} \cdot (\cos(\tilde{\mathbf{P}}) + i \sin(\tilde{\mathbf{P}})) $$
通过逆傅里叶变换将增强后的频域信号转换回空域,得到通道注意力权重图 $\mathbf{W}$:
$$ \mathbf{W} = \text{IFFT}(\hat{\mathbf{Z}}_{enh}, \text{dim}=1) $$
此时 $\mathbf{W}$ 的形状与 $\mathbf{Z}$ 相同 ($B \times C \times 1 \times 1$),但由于广播机制,可与 $\mathbf{X}_{conv}$ 相乘。
最终输出由加权后的特征与原始输入相加得到(双重残差结构):
$$ \mathbf{Y} = (\mathbf{X}_{conv} \odot \mathbf{W}) + \mathbf{X} $$