论文标题:TransAttUnet: Multi-level Attention-guided U-Net withTransformer for Medical Image Segmentation
作者:Bingzhi Chen, Yishu Liu, Yingjian Li, Zheng Zhang, GuangmingLu, Adams Wai Kin Kong
作者机构:哈尔滨工业大学(深圳)医学生物计量感知与分析工程实验室、南洋理工大学计算机科学与工程学院。
发表期刊/会议:IEEE Transactions on Instrumentation & Measurement (2022)
期刊影响力:该期刊属JCR Q2区,在医学图像测量方向具有较高学术认可度。预印本发布于arXiv:2107.05274(2021),代码开源。
研究问题:医学图像语义分割任务中传统U-Net架构难以建模长程依赖关系,导致全局上下文信息捕获不足。
技术目标:通过融合Transformer的全局建模能力与U-Net的局部特征提取优势,提升复杂医学图像(如病灶、器官)的分割精度与细节保留能力。
核心方案:提出TransAttUnet框架,核心创新包括:
自感知注意力模块(SAA)整合Transformer自注意力(TSA)与全局空间注意力(GSA);
多尺度跳跃连接机制(残差/密集连接)优化特征融合;
联合Dice-BCE损失函数解决类别不平衡问题。
Transformer自注意力(TSA):基于多头自注意力机制(Multi-HeadSelf-Attention,MHSA),通过查询(Query)、键(Key)、值(Value)的交互计算全局语义依赖关系。公式定义为:其中 $d_k$ 为特征维度缩放因子,用于稳定梯度。
全局空间注意力(GSA):通过卷积生成位置注意力图,建模像素间空间依赖关系。计算式为:其中 $B_{p,q}$ 表示位置 p 对 q 的影响权重。
多尺度跳跃连接(Multi-Scale Skip Connection):包含级联(Cascade)、残差(Residual)、密集(Dense)三种连接方式,通过上采样、拼接和卷积操作融合不同语义尺度的特征图。
逻辑关系:SAA模块作为编码器-解码器桥梁,TSA捕获长程语义依赖,GSA增强空间一致性,多尺度连接保障细节传递,形成互补的全局-局部特征优化链路。
理论框架:以U-Net的编码器-解码器结构为基础,引入Transformer的序列建模理论,突破卷积操作的局部归纳偏置限制。
现有局限性:
传统U-Net依赖局部卷积,感受野有限;
跳跃连接仅融合同尺度特征,忽略多尺度语义关联;
纯Transformer模型计算复杂度高,需大规模预训练(如TransUNet)。
在U-Net瓶颈层嵌入轻量化SAA模块,平衡计算效率与全局建模;
通过残差/密集连接实现渐进式特征聚合,避免一次性上采样造成的细节丢失。
ISIC-2018:2596张皮肤镜图像,任务为皮肤病变分割,按2076/520划分训练测试集。
肺部X射线组合数据集(JSRT+Montgomery+NIH):563张胸片,任务为肺野分割,按407/178划分。
Clean-CC-CCII:260张COVID-19胸部CT切片,任务为肺炎病灶分割,按200/60划分。
2018 Data Science Bowl:671张细胞核图像,任务为多核分割,按80%/10%/10%划分训练/验证/测试。
GlaS:165张结肠腺体组织学图像,任务为腺体分割,按85/80划分。所有图像统一缩放至512×512或256×256分辨率,并进行标准化预处理。
注意力引导模型:Attention U-Net [10]、Channel-UNet [8]、PraNet [40];
多尺度上下文模型:U-Net++ [9]、ResUNet++ [42]、DoubleU-Net [36];
Transformer基线:Swin-Unet [44]、MCTrans [30]、SegFormer [45]。
选择原则覆盖三类主流改进方向,确保对比全面性。
Dice系数:$\text{Dice} = \frac{2 \times TP}{2 \times TP + FP + FN}$,衡量分割重叠度;
IoU:$\text{IoU} = \frac{TP}{TP + FP + FN}$,评估交集占比;
准确率(ACC)、召回率(REC)、精确率(PRE)基于像素级计算。
皮肤病变分割(ISIC-2018):TransAttUnet_R达到90.74% Dice分数,优于MCTrans(90.35%)和Swin-Unet(89.72%);
肺野分割:TransAttUnet_R取得98.88% Dice,较U-Net(96.17%)提升2.71%;
COVID-19病灶分割:在Clean-CC-CCII上Dice达86.57%,显著超越PraNet(84.82%);
细胞核与腺体分割:在Bowl和GlaS数据集上Dice分别为91.62%和89.11%,均达到SOTA。
多级注意力贡献:消融实验显示,移除SAA模块(TAU w/o TSA+GSA)使Dice下降约6%(如皮肤任务从90.74%→83.89%);
多尺度连接有效性:残差连接(TransAttUnet_R)在多数任务中优于密集连接,如COVID-19任务Dice提升0.49%(86.57% vs. 86.08%);
全局上下文建模:如图6可视化显示,TransAttUnet在解码器深层保留更清晰的边界细节。
{width="5.772222222222222in"
height="2.2169925634295713in"}
组件依赖关系:SAA与多尺度连接的协同作用显著(完整模型比单一组件移除版本Dice平均高3-5%);
计算效率权衡:虽引入Transformer,但通过8头注意力机制控制计算量,在单GPU(Titan XP)可完成训练。
{width="5.772222222222222in"
height="1.6856922572178479in"}
架构创新:在U-Net中耦合TSA与GSA,实现全局语义与空间关系的双重建模;
工程实用性:多尺度连接设计缓解了医学图像中小目标分割的细节丢失问题,适用于多模态数据;
理论价值:为Transformer在轻量化医学模型中的嵌入提供了方法。
计算复杂度:SAA模块的注意力矩阵计算与特征图尺寸平方相关,处理高分辨率CT图像时内存占用较高;
数据依赖性:在小型数据集(如GlaS仅165张样本)上仍有过拟合风险,需依赖数据增强;
实时性不足:较纯CNN模型推理速度下降约30%,限制临床实时应用。
基于论文的实验设计,TransAttUnet在以下场景表现突出:
复杂边界结构分割:如皮肤病灶(ISIC-2018)和腺体(GlaS)的不规则轮廓,依赖TSA的长程依赖建模能力;
多目标重叠场景:细胞核分割(Bowl)中,GSA的空间注意力能区分密集相邻目标;
低对比度区域识别:COVID-19肺炎病灶(Clean-CC-CCII)与正常组织对比度低,多尺度连接保障细节提取;
跨模态泛化:在X射线(肺野)、CT(肺炎)、显微镜(细胞)等不同成像模态均验证有效性,体现架构强泛化性。
轻量化设计:引入滑动窗口注意力(如Swin Transformer)或线性注意力机制降低计算复杂度;
自监督预训练:利用MAE或MoCo-v3策略在未标注医学图像上预训练,提升小数据场景性能;