2.Beyond Self-Attention_ Deformable Large Kernel A.md 27 KB

Beyond Self-Attention: Deformable Large Kernel Attention for Medical Image Segmentation——可变形大核注意力在医学图像分割中的应用

基本信息

作者

  • Reza Azad(第一作者)

  • Leon Niggemeier

  • Michael Huttemann

  • Amirhossein Kazerouni

  • Ehsan Khodapanah Aghdam

  • Yury Velichko

  • Ulas Bagci

  • Dorit Merhof(通讯作者)

作者机构

  1. RWTH Aachen University(德国亚琛工业大学电气工程与信息技术学院)

  2. Iran University of Science and Technology(伊朗科技大学电气工程学院)

  3. Shahid Beheshti University(伊朗沙希德·贝赫什提大学电气工程学院)

  4. Northwestern University(美国西北大学放射科)

  5. University of Regensburg(德国雷根斯堡大学信息与数据科学学院)

  6. Fraunhofer Institute for Digital Medicine MEVIS(德国弗劳恩霍夫数字医学研究所MEVIS)

作者机构研究实力分析

1. RWTH Aachen University

  • 研究方向:计算机视觉、医学图像处理、深度学习。

  • 实验室排名

    • 在CVPR、ICCV、MICCAI等顶级会议中持续产出高影响力论文。

    • 医学图像分析团队(如Michael Huttemann、Dorit Merhof)在器官分割、病变检测领域具有国际领先地位。

2. Fraunhofer MEVIS

  • 研究方向:医学影像分析、计算机辅助诊断(CAD)、深度学习与医学应用结合。

  • 行业地位

    • 欧洲顶尖医学影像研究机构,与西门子医疗等企业深度合作。

    • 在3D医学图像分割、动态器官建模领域具有权威性。

3. Northwestern University

  • 研究方向:放射学、医学图像计算。

  • 实验室特色

    • 专注于临床数据驱动的算法开发,尤其在胰腺、脑部病变分割中表现突出。

会议学术影响力评估

WACV(IEEE/CVF Winter Conference on Applications of Computer Vision)

  • CCF分类:B类会议(中国计算机学会)。

  • JCR分区:Q2(计算机视觉领域,2023年影响因子约5.8)。

  • 对标会议

    • 高于ICIP(CCF-C),低于CVPR(CCF-A)、ICCV(CCF-A)。
  • 领域认可度

    • 聚焦计算机视觉应用,涵盖医学影像、自动驾驶、视频分析等方向。

    • 2024年接收率约41%,竞争激烈,论文质量较高。

该论文由多国顶尖机构联合完成,作者团队在医学图像分析与深度学习领域具有深厚积累。WACV作为应用导向的顶级会议,进一步验证了研究的实用性与创新性。D-LKA机制为医学图像分割提供了高效解决方案,尤其在处理复杂器官形变和3D数据时表现突出。

文献概述

研究问题

医学图像分割面临低对比度、器官形态多变等固有挑战,现有方法存在显著局限:CNN受限于局部感受野难以捕获全局依赖关系,传统Transformer则因高计算成本难以实用化。尤其在三维医学影像中,现有架构常出现"missing crucial inter-slice information"的问题,导致层间关联信息丢失,影响分割精度与一致性。这些技术瓶颈共同构成了D-LKA方法提出的核心动机。

技术目标

D-LKA 的技术目标与医学图像分割领域的核心研究问题紧密对应,通过三大技术路径实现针对性突破:采用大核卷积设计降低传统注意力机制的计算复杂度,解决高分辨率医学图像处理中的效率瓶颈;构建 3D 架构增强层间信息捕捉能力,以适应医学影像的立体结构特征;引入可变形卷积模块动态适配器官形态变异,提升对解剖结构形变的鲁棒性。这一目标体系通过多技术协同,系统性解决了医学图像分割中效率、立体信息利用与形变适应性的关键矛盾,体现了技术设计的逻辑性与应用必要性。

技术目标核心逻辑:通过大核卷积-3D 架构-可变形卷积的技术组合,形成覆盖计算效率、空间信息建模与解剖变异适应的完整解决方案,直接对应医学图像分割场景的特殊需求。

核心技术方案

a848ae278fc9258e2d5ac97bd8791300.png

D - LKA 模块通过大核卷积实现全局感受野,其参数计算参考公式 1 - 2。同时,引入可变形卷积,借助偏移学习适配病灶形状。在 2D/3D 网络整体架构中,该模块创新地实现了单模块对全局 - 局部信息的融合。

技术亮点:D - LKA 模块突破传统注意力机制局限,在保持参数效率的同时,通过大核卷积与可变形卷积的协同设计,实现了医学图像分割中全局上下文感知与局部病灶细节捕捉的双重需求。

文献的概念

核心技术术语

  • 可变形大核注意力 - Deformable Large Kernel Attention (D-LKA) - 一种基于卷积操作的注意力机制,无需对输入图像进行 token 化处理,通过在大核注意力基础上引入可变形采样策略,能够动态调整感受野以适应医学图像中目标的不规则形态与边界特征。
  • 大核注意力 - Large Kernel Attention (LKA) - 采用固定卷积核进行全局上下文建模的注意力机制,通过大尺寸卷积核实现长距离依赖捕捉,但缺乏对目标几何形变的适应性调整能力。
  • 传统自注意力 - Traditional Self-Attention - 基于 token 化输入的注意力机制,通过计算序列中所有 token 对之间的相似度生成注意力权重,存在计算复杂度高、需图像分块处理等问题,在医学图像分割中易丢失空间连续性。

技术差异核心:D-LKA 与传统自注意力的本质区别在于摒弃 token 化流程,完全基于卷积操作实现;与 LKA 的关键差异在于引入可变形采样,使感受野能够根据目标形态动态调整,更适配医学图像中病灶区域的复杂几何特征。

技术概念定义

本章节将从数学原理层面系统阐释 D-LKA 核心技术的理论基础。首先通过公式解析大核卷积的参数优化机制,揭示其在保持大感受野优势的同时实现参数规模缩减的内在逻辑;随后深入分析偏移场学习的数学过程,阐明可变形卷积如何通过动态调整采样位置实现对医学图像中不规则目标的自适应特征提取。最终通过公式拆解 D-LKA 的完整计算流程,清晰呈现"特征变换-注意力加权-残差输出"三个关键环节的协同作用机制,为后续技术应用分析奠定理论基础。

核心技术特征:D-LKA 通过融合大核卷积的全局感知能力与可变形卷积的空间适应性,构建了兼具参数效率与特征表达能力的注意力机制,其数学框架确保了在医学图像分割任务中对细微结构和复杂边界的精准捕捉。

技术间逻辑关系

D-LKA 模块构建了“全局-局部”双重视角的特征提取机制:大核卷积负责全局上下文建模以捕获长距离依赖关系,可变形卷积通过动态调整采样位置实现局部形状适配,二者特征经 1×1 卷积融合输出。这种结构设计使模型在保持计算效率的同时,通过互补机制提升分割精度,有效平衡了复杂度与性能需求。

技术协同核心:大核卷积提供全局感受野,可变形卷积实现局部几何自适应,1×1 卷积完成特征维度统一与信息整合,三者形成有机整体。

文献的理论基础

理论框架

d9c69de58c1ad94ab275b8cab71927dc.png781726ee7895459695c355b4f1336e9c.png

D-LKA Net 的理论框架核心在于融合 U-Net 与 Transformer 的架构优势。其编码器借鉴 MaxViT 的高效特征提取机制,在保留局部细节的同时实现多尺度特征融合;解码器则通过创新的 D-LKA 模块构建长距离依赖关系,增强全局上下文关联。这种"局部-全局"协同的设计思路,突破了传统 U-Net 感受野局限与纯 Transformer 计算复杂度高的双重瓶颈。

架构融合关键点:编码器采用 MaxViT 实现高效局部特征提取,解码器通过 D-LKA 模块强化全局关联,形成兼具细节捕捉与长程依赖建模能力的混合架构。

现有技术局限性

在医学图像分割领域,现有技术面临着与医学图像数据特性之间的显著矛盾。医学图像通常表现为三维体数据形式,且包含小器官占比低等特点,这对现有注意力机制的计算效率和参数规模提出了严峻挑战。以自注意力机制为例,当特征图序列长度N=512时,其计算量可达26万次,这种指数级增长的计算复杂度难以满足临床应用中对实时性和资源效率的需求。

b21a13eeab97e5019592b917022d1039.png

d02f6b1233c4462559af9656257df634.png

893f3e4290932d38ddd11cf58adfe53c.png

关键技术瓶颈:传统自注意力机制在处理医学图像时,因二维和三维数据特性导致计算成本激增,而D-LKA通过公式3-7实现参数规模控制在百万级,显著缓解了这一矛盾,凸显了技术改进的必要性。

这种局限性不仅制约了模型在实际医疗场景中的部署可行性,也限制了算法对小器官区域的精细分割能力,因此亟需发展新型注意力机制以突破现有技术框架的固有约束。

改进思路

D-LKA 的改进思路围绕医学图像分割的核心挑战构建三维突破路径:采用深度可分离卷积结合膨胀卷积实现大感受野提升计算效率,通过可变形卷积的偏移学习增强不规则边界捕捉精度,设计 3D 架构直接处理体数据避免层间信息丢失,形成“效率 - 精度 - 维度”协同优化方案。

技术组合

  • 大核卷积:深度可分离 + 膨胀策略平衡感受野与计算成本
  • 边界优化:可变形卷积动态调整采样位置适配医学图像拓扑复杂性
  • 维度扩展:3D 架构保留空间上下文关系提升体数据分割完整性

创新点与理论体系关联性

D-LKA 在医学图像分割理论体系中,为“卷积 - 注意力融合”方向提供新视角,证明大核卷积可高效替代自注意力,为轻量化模型设计奠定理论基础。

核心贡献:确立大核卷积作为自注意力替代方案的理论可行性,推动医学图像分割模型向高效轻量化发展。

文献的实验方法

数据集描述

为全面验证 D-LKA 模型在医学图像分割任务中的性能,本研究精心选取了三类具有代表性的数据集,形成多场景、多器官的评估体系。Synapse 多器官数据集包含 8 类腹部器官(如肝脏、肾脏、脾脏等)的 CT 影像,覆盖多器官分割的复杂场景;NIH Pancreas 数据集专注于胰腺这一小器官的分割挑战,验证模型对低对比度、边界模糊区域的处理能力;ISIC 皮肤病变数据集则提供 2D 临床图像,用于验证模型在平面医学影像场景下的泛化性能。这种数据集组合策略确保了实验评估的全面性,能够充分反映模型在不同解剖结构、成像模态下的分割表现。

在数据预处理阶段,针对不同模态图像特性实施了针对性处理:CT 切片采用 Z-score 标准化消除设备差异,同时通过窗宽窗位调整突出器官边界;皮肤图像则进行对比度受限自适应直方图均衡化(CLAHE)增强纹理细节,并采用随机翻转、旋转实现数据扩充。这些预处理步骤为后续模型训练提供了标准化输入,有效提升了实验结果的可靠性与可重复性。

数据集设计特点:通过多模态(CT/2D 图像)、多尺度(大器官/小器官)、多病种(腹部/皮肤)的数据集组合,构建了全面的模型评估框架,既验证基础分割能力,又测试特殊场景适应性。

基线模型选择原则

为确保对比实验的科学性与结论可靠性,本研究基线模型选择遵循两大核心原则:技术路线代表性性能公平性。通过选取不同技术范式的典型模型构建对比体系,涵盖高效 Transformer 代表(如 UNETR++)与 CNN 类 SOTA 模型(如 nnFormer),实现对 D - LKA 跨技术路线普适优势的验证。

关键对比数据:D - LKA 以 42.35 M 参数实现 87.49% DSC,对比 UNETR++(42.96 M 参数,87.22% DSC),在参数规模降低 1.4% 的同时,分割精度提升 0.27%,验证了其在低参数约束下的性能领先优势。

实验数据表明,所选基线模型在参数规模与性能水平上形成合理梯度,为 D - LKA 注意力机制的有效性提供了严谨参照系。

评估指标计算公式

在医学图像分割任务中,评估指标的选择需兼顾算法性能的多维度表征与临床应用的实际需求。

Dice 相似系数(DSC) 作为医学分割领域的标准量化指标,其计算公式为 DSC = 2|X∩Y|/(|X|+|Y|),其中 X 表示预测分割结果,Y 代表标准标注,该指标通过计算交集与并集的比值,对类别不平衡问题具有高度敏感性,特别适用于小器官或病灶区域的分割精度评估。

多维度评估体系:除 DSC 外,HD95(95% 豪斯多夫距离)用于衡量分割边界的空间一致性,Params(模型参数总量)和 FLOPs(浮点运算次数)则从计算效率角度评估模型的临床部署可行性,共同构成兼顾准确性与实用性的综合评价框架。

通过上述指标的协同应用,可全面反映 D - LKA 模型在医学图像分割任务中的临床适用性与技术优势。

实验设计与结果分析

db6597ea2a58f33c9d4e0358801913d1.png12b7bb482480852b15721f0d65aa8016.pnga8fb1271dbe138efbaf13c211c897e08.png

8ca4660448c9b1949e02e351d8ef9af0.png

本研究采用控制变量法系统验证模型性能,重点通过两组关键实验揭示技术创新价值。在架构对比实验中,3D模型在 Synapse 数据集上的 DSC 指标较 2D 模型提升 3.22%,量化证明了三维空间信息对医学图像分割的必要性。消融实验进一步表明,D-LKA 模块作为核心创新组件,对模型性能贡献度最高。定性结果(图 3-6)显示,集成 D-LKA 的模型在胰腺等复杂器官分割中展现出更清晰的边界轮廓,与定量数据形成互补验证,共同支撑了方法的有效性。

核心发现:3D 架构与 D-LKA 模块的协同作用使模型在保持计算效率的同时,实现了医学图像分割精度的显著提升,尤其改善了小器官和边界区域的分割效果。

文献的结论

8cc3b70a5187cbc6be6df4a76a2c6f90.png

D - LKA 论文的结论展现出较好的严谨性,其技术目标与实验结果高度契合。在解决跨切片信息丢失问题上,3D 模型架构通过对三维空间信息的有效建模得以实现;而 D - LKA 模块在降低复杂度方面成效显著,表 3 数据显示其参数量仅为 Swin - UNETR 的 17%,这一数据有力支撑了模型轻量化的优势主张。然而,研究仍存在一定局限性,最突出的是 3D FLOPs 达到 66.96G,高于 UNETR++ 的 47.98G,这表明模型在计算效率方面还有优化空间。该研究结论为后续改进提供了明确方向:需在保持现有分割精度与参数效率优势的基础上,重点探索降低计算复杂度的技术路径,例如通过改进注意力机制的计算方式或引入更高效的特征融合策略。

个人思考和总结

D-LKA 作为一种融合可变形卷积与大核注意力机制的创新架构,其在医学图像分割领域的价值需结合具体临床场景进行差异化评估。在多器官分割任务中,该模型通过 大核卷积的全局感受野 有效捕捉器官间的空间布局关系,解决了传统小核网络对解剖结构整体性描述不足的问题;而在小器官(如肾上腺、垂体)分割场景下,其 可变形卷积模块 能够动态调整采样位置,精准适配病灶的不规则形态特征,显著提升边界定位精度。

针对皮肤 lesion 等平面图像分割任务,D-LKA 的 2D 模型设计展现出 计算效率优势,在保证分割性能的同时降低了内存占用;而在处理 CT/MRI 等 3D 体数据时,其跨切片注意力机制通过建立相邻层间的关联建模,有效保留了病灶在三维空间中的连续性,缓解了传统 2D 方法的层间信息割裂问题。

从临床转化角度看,D-LKA 仍需在以下方向优化:针对医学数据标注稀缺的核心痛点,可探索 半监督学习框架的融合,通过少量标注数据引导模型从大量未标注图像中学习有效特征;在技术层面,建议开发基于病灶尺寸的 动态核大小调节机制,使卷积核参数能根据输入图像中目标区域的尺度自适应调整,进一步提升模型对不同大小病灶的适应能力。这些改进需紧密结合 D-LKA 的注意力机制特性,确保技术创新与临床需求的深度耦合。

核心适配场景:

  • 多器官分割:大核卷积捕捉全局布局
  • 小器官分割:可变形卷积适配不规则形态
  • 2D 平面图像(如皮肤 lesion):高效计算设计降低内存消耗
  • 3D 体数据:跨切片注意力维持空间连续性

整体评估

D-LKA 论文在医学图像分割领域展现出多维度价值。原创性方面,其核心贡献在于 D-LKA 模块 的创新性设计,通过融合大核卷积与可变形卷积的技术特性,突破了传统注意力机制依赖固定感受野的框架限制,为捕捉医学图像中复杂形态特征提供了新思路。工程实现层面,论文采用代码开源策略,并确保模块具备高度兼容性,可无缝嵌入 U-Net 或 Transformer 等主流分割架构,降低了临床转化与二次开发的技术门槛。

领域影响力方面,该研究通过在 CT 影像与皮肤图像数据集上的系统验证,不仅提供了可复现的实验基准,更展示了医学影像分割的 "高效特征提取-精准边界定位" 的融合方向发展的潜力。

import torch
import torch.nn as nn
import torchvision


class DeformConv(nn.Module):
    """
    可变形卷积模块
    通过学习偏移量来调整卷积核的采样位置,使卷积能够适应不同的输入形状
    """

    def __init__(self, in_channels, groups, kernel_size=(3, 3), padding=1, stride=1, dilation=1, offset_net_bias=True,
                 deform_conv_bias=False):
        """
        初始化可变形卷积
        
        Args:
            in_channels: 输入通道数
            groups: 分组卷积的组数
            kernel_size: 卷积核大小
            padding: 填充大小
            stride: 步长
            dilation: 膨胀率
            offset_net_bias: 偏移网络是否使用偏置
            deform_conv_bias: 可变形卷积是否使用偏置
        """
        super(DeformConv, self).__init__()

        # 偏移量预测网络:用于学习卷积核每个位置的偏移量
        # 输出通道数为 2 * kernel_height * kernel_width,因为每个位置需要预测x,y两个方向的偏移
        self.offset_net = nn.Conv2d(in_channels=in_channels,
                                    out_channels=2 * kernel_size[0] * kernel_size[1],
                                    kernel_size=kernel_size,
                                    padding=padding,
                                    stride=stride,
                                    dilation=dilation,
                                    bias=offset_net_bias)

        # 可变形卷积操作:根据输入特征和偏移量进行卷积计算
        self.deform_conv = torchvision.ops.DeformConv2d(in_channels=in_channels,
                                                        out_channels=in_channels,
                                                        kernel_size=kernel_size,
                                                        padding=padding,
                                                        groups=groups,
                                                        stride=stride,
                                                        dilation=dilation,
                                                        bias=deform_conv_bias)

    def forward(self, x):
        """
        前向传播
        
        Args:
            x: 输入特征图 [B, C, H, W]
            
        Returns:
            out: 输出特征图 [B, C, H, W]
        """
        # 预测每个像素位置的卷积核偏移量
        offsets = self.offset_net(x)
        # 使用偏移量进行可变形卷积操作
        out = self.deform_conv(x, offsets)
        return out


class deformable_LKA(nn.Module):
    """
    基于可变形卷积的大核注意力机制 (Large Kernel Attention)
    通过大感受野捕获长距离依赖关系,并利用可变形卷积提高效率
    """

    def __init__(self, dim):
        """
        初始化可变形LKA模块
        
        Args:
            dim: 输入特征的通道数
        """
        super().__init__()
        # 局部特征提取:使用5x5可变形卷积捕获局部上下文信息
        self.conv0 = DeformConv(dim, kernel_size=(5, 5), padding=2, groups=dim)
        # 长距离依赖建模:使用7x7可变形卷积(空洞率为3)扩大感受野
        self.conv_spatial = DeformConv(dim, kernel_size=(7, 7), stride=1, padding=9, groups=dim, dilation=3)
        # 特征映射:将注意力权重映射回原始维度
        self.conv1 = nn.Conv2d(dim, dim, 1)

    def forward(self, x):
        """
        前向传播
        
        Args:
            x: 输入特征图 [B, C, H, W]
            
        Returns:
            输出特征图 [B, C, H, W]
        """
        # 保存原始输入用于后续元素级乘法
        u = x.clone()
        # 第一步:局部特征提取,捕获邻近区域的信息
        attn = self.conv0(x)
        # 第二步:空间注意力建模,捕获长距离依赖关系
        attn = self.conv_spatial(attn)
        # 第三步:通道维度映射,生成最终的注意力权重
        attn = self.conv1(attn)

        # 将原始输入与注意力权重相乘,实现特征选择和增强
        return u * attn


class deformable_LKA_Attention(nn.Module):
    """
    可变形LKA注意力模块
    结合了通道投影、激活函数和可变形大核注意力机制
    """

    def __init__(self, d_model):
        """
        初始化可变形LKA注意力模块
        
        Args:
            d_model: 模型的通道维度
        """
        super().__init__()

        # 第一个通道投影:将输入特征映射到相同的维度空间
        self.proj_1 = nn.Conv2d(d_model, d_model, 1)
        # 激活函数:引入非线性变换
        self.activation = nn.GELU()
        # 空间门控单元:核心的可变形LKA注意力机制
        self.spatial_gating_unit = deformable_LKA(d_model)
        # 第二个通道投影:将注意力增强后的特征映射回输出空间
        self.proj_2 = nn.Conv2d(d_model, d_model, 1)

    def forward(self, x):
        """
        前向传播
        
        Args:
            x: 输入特征图 [N, C, H, W]
            
        Returns:
            输出特征图 [N, C, H, W]
        """
        # 保存残差连接
        shortcut = x.clone()
        # 通道投影和激活:将输入特征映射到注意力计算空间
        x = self.proj_1(x)
        x = self.activation(x)
        # 空间注意力机制:通过可变形LKA增强特征表达
        x = self.spatial_gating_unit(x)
        # 通道投影:将增强后的特征映射到输出空间
        x = self.proj_2(x)
        # 残差连接:将增强后的特征与原始输入相加
        x = x + shortcut
        return x


if __name__ == "__main__":
    input_ = torch.rand(1, 32, 64, 64)
    model = deformable_LKA_Attention(d_model=32)

    # 设置设备
    device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
    input_tensor = input_.to(device)
    model = model.to(device)

    # 前向传播
    output = model(input_tensor)

    # 输出模型结构与输入输出形状
    print(model)
    print("输入张量形状:", input_tensor.shape)  # [B, C, H, W]
    print("输出张量形状:", output.shape)  # [B, C, H, W]

个人理解的deformable_LKA_Attention 模块的意义和工作原理

可以把 deformable_LKA_Attention 想象成一个"智能聚焦镜头",就像摄影师使用的高级相机镜头一样。

对比摄影师拍摄风景照

想象一下摄影师要拍摄一张复杂的风景照片,画面中有山、水、树、房子等各种元素:

  1. 普通镜头的问题:普通的相机镜头只能固定焦点,要么对焦在前景的花朵上,要么对焦在远处的山峰上,很难让整个画面的所有元素都清晰锐利。

  2. deformable_LKA_Attention 就像智能变焦镜头

    • 它能自动识别画面中最重要的部分(比如那个红色的小房子)
    • 动态调整焦点位置和范围,让重要的部分更加突出
    • 同时还能保持对周围环境的感知,不会丢失全局信息

第一层:DeformConv(可变形卷积)

这就像摄影师的手持稳定器:

  • 普通卷积就像固定在一个位置拍照,不管拍摄对象怎么动
  • 可变形卷积就像智能稳定器,能根据拍摄对象的移动自动调整角度和位置
  • 它会"学习"哪里需要重点关注,然后把焦点偏移到那些重要位置

第二层:LKA(大核注意力)

这就像摄影师使用的超广角镜头:

  • 普通镜头视野有限,只能看到局部
  • 大核注意力就像超广角镜头,能看到更大范围的画面
  • 但它不是简单地放大视野,而是智能地决定哪些区域更重要

第三层:整个 Attention 模块

这就类似摄影师的一整套智能拍摄系统:

  1. 首先分析整个画面 (proj_1 + activation)
  2. 然后智能聚焦到重要区域 (spatial_gating_unit)
  3. 最后合成优化过的照片 (proj_2)
  4. 并保留原始照片作为参考 (shortcut 连接)

实际应用场景

在医学图像分割中,就像医生看X光片:

  • X光片上有很多组织和器官重叠在一起
  • 医生需要关注特定病变区域,但也要了解周围的组织情况
  • deformable_LKA_Attention 就像一个智能辅助诊断系统:
    • 自动识别可能有问题的区域(比如肺结节)
    • 动态调整"关注点",更好地突出可疑区域
    • 同时保留整体结构信息,避免因缺失完整信息导致的误判

优势:

  1. 灵活性:不像传统方法那样死板,可以根据输入内容灵活调整关注重点
  2. 高效性:只在真正重要的地方花精力,避免无用功
  3. 全局感知:既关注重点区域,又不忘整体结构
  4. 自适应:能够根据不同类型的输入自动调整处理方式

自动找出最重要最有价值的部分,并且把这些部分变得更加突出,同时保持对整体的理解。