2. 2个创新点--公式描述.md 4.8 KB

1. AWAE

1.1 离散小波变换 (DWT)

输入特征图 $X \in \mathbb{R}^{B \times C \times H \times W}$ 首先经过 $J$ 层离散小波变换,分解为低频分量 $Y_L$ 和高频分量集合 $Y_H = {YH^{(i)}}{i=1}^J$:

$$ (Y_L, Y_H) = \text{DWT}(X) $$

其中,第 $i$ 层的高频分量 $Y_H^{(i)} \in \mathbb{R}^{B \times C \times 3 \times H_i \times W_i}$ 包含三个方向(水平、垂直、对角)的子带。

1.2 AAE-注意力权重计算

对于任意输入子带特征 $S$(无论是 $Y_L$ 还是 $Y_H^{(i)}$ 中的某个子带),通过 AWA 计算增强权重:

  • 基础通道注意力 ($W_{base}$):

    $$ W_{base} = \sigma(\text{Conv}_2(\delta(\text{Conv}_1(\text{GAP}(S))))) $$

    其中 $\text{GAP}$ 为全局平均池化,$\delta$ 为 ReLU 激活,$\sigma$ 为 Sigmoid 激活,$\text{Conv}_1, \text{Conv}_2$ 为降维和升维的卷积操作。

  • 融合门控因子 ($G$):

    $$ G = \sigma(\text{Conv}'_2(\delta(\text{Conv}'_1(\text{GAP}(S))))) $$

    结构与基础注意力相同,但参数独立。

  • 动态增强因子 ($E$):

    $$ E = 1 + (\beta \cdot G) $$

    其中 $\beta$ 是可学习参数 bias_scale(低频初始化为 0.2,高频为 0.4)。

  • 最终权重 ($W_{final}$):

    $$ W{final} = \text{clamp}(W{base} \odot E, \min=0.1) $$

    此处 $\odot$ 表示逐元素乘法,$\text{clamp}$ 确保权重下限为 0.1。

  • 特征增强输出 ($S'$):

    $$ S' = S \odot W_{final} $$

1.3子带差异化处理

  • 低频增强:

    $$ Y'L = \text{Attention}{LL}(Y_L) $$

    使用独立的注意力模块$\text{Attention}_{LL}$处理低频分量。

  • 高频增强:
    对于每一层 $i \in [1, J]$ 和每个方向 $j \in {0, 1, 2}$:

    1. 提取子带:$S_{i,j} = Y_H^{(i)}[:, :, j, :, :]$
    2. 应用对应层级的注意力模块:$S'{i,j} = \text{Attention}{HH}^{(i)}(S_{i,j})$
    3. 重组高频分量:$Y'^{(i)}H = \text{Stack}({S'{i,0}, S'{i,1}, S'{i,2}}, \text{dim}=2)$

1.4 逆离散小波变换 (IDWT)

将增强后的低频分量 $Y'_L$ 和高频分量集合 $Y'_H = {Y'^{(i)}H}{i=1}^J$ 重构回原始空间:

$$ X' = \text{IDWT}(Y'_L, Y'_H) $$

最终输出 $X'$ 即为经过自适应小波子带增强后的特征图。

2.FRCAB

1. 局部特征提取 (卷积分支)

首先通过两个 $3 \times 3$ 卷积和一个激活函数提取局部特征:

$$ \mathbf{X}_{conv} = \text{Conv}_2(\text{LeakyReLU}(\text{Conv}_1(\mathbf{X}))) $$

其中 $\mathbf{X} \in \mathbb{R}^{B \times C \times H \times W}$ 为输入,$\mathbf{X}_{conv}$ 为卷积分支输出。

2. 全局空间池化

对 $\mathbf{X}_{conv}$ 进行全局平均池化,压缩空间维度:

$$ \mathbf{Z} = \text{GAP}(\mathbf{X}_{conv}) \in \mathbb{R}^{B \times C \times 1 \times 1} $$

3. 通道注意力参数学习 (频域增强网络)

利用两个独立的轻量级 CNN 分支分别学习幅度和相位的增强系数:

$$ \mathbf{M}a = f{\theta_a}(\mathbf{Z}), \quad \mathbf{M}p = f{\theta_p}(\mathbf{Z}) $$

其中 $f_{\theta}$ 代表代码中的 xc_aEnhance 和 xc_pEnhance 序列(Conv-ReLU-Conv)。

4. 频域分解 (通道维度的 FFT)

对池化特征 $\mathbf{Z}$ 沿通道维度 ($dim=1$) 进行快速傅里叶变换:

$$ \hat{\mathbf{Z}} = \text{FFT}(\mathbf{Z}, \text{dim}=1) $$

分解得到幅度谱 $\mathbf{A}$ 和相位谱 $\mathbf{P}$:

$$ \mathbf{A} = |\hat{\mathbf{Z}}|, \quad \mathbf{P} = \angle(\hat{\mathbf{Z}}) $$

5. 频域增强与重构

将学习到的系数应用于幅度和相位,并重构复数信号:

  • 增强操作

    $$ \tilde{\mathbf{A}} = \mathbf{A} \odot \mathbf{M}_a, \quad \tilde{\mathbf{P}} = \mathbf{P} \odot \mathbf{M}_p $$

    ($\odot$ 表示逐元素乘法)

  • 复数重构

    $$ \hat{\mathbf{Z}}_{enh} = \tilde{\mathbf{A}} \cdot (\cos(\tilde{\mathbf{P}}) + i \sin(\tilde{\mathbf{P}})) $$

6. 生成注意力权重 (逆 FFT)

通过逆傅里叶变换将增强后的频域信号转换回空域,得到通道注意力权重图 $\mathbf{W}$:

$$ \mathbf{W} = \text{IFFT}(\hat{\mathbf{Z}}_{enh}, \text{dim}=1) $$

此时 $\mathbf{W}$ 的形状与 $\mathbf{Z}$ 相同 ($B \times C \times 1 \times 1$),但由于广播机制,可与 $\mathbf{X}_{conv}$ 相乘。

7. 特征加权与残差连接

最终输出由加权后的特征与原始输入相加得到(双重残差结构):

$$ \mathbf{Y} = (\mathbf{X}_{conv} \odot \mathbf{W}) + \mathbf{X} $$