计算机系统应用  2024, Vol. 33 Issue (5): 15-27   PDF    
双分支注意力与FasterNet相融合的航拍场景分类
杨本臣, 曲业田, 金海波     
辽宁工程技术大学 软件学院, 葫芦岛 125105
摘要:航拍高分辨率图像的场景类别多且类间相似度高, 经典的基于深度学习的分类方法, 由于在提取特征过程中会产生冗余浮点运算, 运行效率较低, FasterNet通过部分卷积提高了运行效率但会降低模型的特征提取能力, 从而降低模型的分类精度. 针对上述问题, 提出了一种融合FasterNet和注意力机制的混合结构分类方法. 首先采用“十字型卷积模块”对场景特征进行部分提取, 以提高模型运行效率. 然后采用坐标注意力与通道注意力相融合的双分支注意力机制, 以增强模型对于特征的提取能力. 最后将“十字型卷积模块”与双分支注意力模块之间进行残差连接, 使网络能训练到更多与任务相关的特征, 从而在提高分类精度的同时, 减小运行代价, 提高运行效率. 实验结果表明, 与现有基于深度学习的分类模型相比, 所提出的方法, 推理时间短而且准确率高, 参数量为19M, 平均一张图像的推理时间为7.1 ms, 在公开的数据集NWPU-RESISC45、EuroSAT、VArcGIS (10%)和VArcGIS (20%)的分类精度分别为96.12%、98.64%、95.42%和97.87%, 与FasterNet相比分别提升了2.06%、0.77%、1.34%和0.65%.
关键词: 遥感场景    图像分类    注意力机制    残差连接    FasterNet    
Aerial Scene Classification by Fusion of Dual-branch Attention and FasterNet
YANG Ben-Chen, QU Ye-Tian, JIN Hai-Bo     
Software College, Liaoning University of Engineering and Technology, Huludao 125105, China
Abstract: The scenes in high-resolution aerial images are of many highly similar categories. The classic classification method based on deep learning offers low operational efficiency because of the redundant floating-point operations generated in the feature extraction process. FasterNet improves the operational efficiency through partial convolution but reduces the feature extraction ability and hence the classification accuracy of the model. To address the above problems, this study proposes a hybrid structure classification method integrating FasterNet and the attention mechanism. Specifically, the “cross-shaped convolution module” is used to partially extract scene features and thereby improve the operational efficiency of the model. Then, a dual-branch attention mechanism that integrates coordinate attention and channel attention is used to enable the model to better extract features. Finally, a residual connection is made between the “cross-shaped convolution module” and the dual-branch attention module so that more task-related features can be obtained from network training, thereby reducing operational costs and improving operational efficiency in addition to improving classification accuracy. The experimental results show that compared with the existing classification models based on deep learning, the proposed method has a short inference time and high accuracy. Its number of parameters is 19M, and its average inference time for one image is 7.1 ms. The classification accuracy of the proposed method on the public datasets NWPU-RESISC45, EuroSAT, VArcGIS (10%), and VArcGIS (20%) is 96.12%, 98.64%, 95.42%, and 97.87%, respectively, which is 2.06%, 0.77%, 1.34%, and 0.65% higher than that of the FasterNet model, respectively.
Key words: remote sensing scene     image classification     attention mechanism     residual connection     FasterNet    

遥感图像是指通过遥感技术获取的地球表面或大气层的图像数据, 获取方式包括卫星遥感、航空摄影、雷达遥感等[1]. 近些年来, 随着遥感技术的发展, 遥感图像的质量在不断提升, 并且图像获取变得更加容易, 这使得遥感图像在自然灾害预测[2]、城乡规划[3]、植被制图[4]和土地覆盖分类[5]等方面得到了日趋广泛的应用.

场景分类是遥感影像领域中一个重要的研究方向. 遥感场景是指通过遥感技术获取到的多种地物目标以特定的空间布局形成的场景区域. 同类场景的不同方位可能分布着多种类型的地物目标, 不同类的场景中可能只包含存在空间布局差异的相同类型地物目标, 这给建立底层地物目标与高层语义之间的联系带来了巨大挑战. 类别多并且不同类之间相似度高, 导致现有模型在分类精度和分类时间上均有进一步提升的空间.

早期研究通过手动设计特征的方法来计算类间相似度, 从而对不同的场景类进行区分. 例如最大似然法[6]、最小距离法[7]和逻辑回归等分类算法[8], 但是这类方法出现了“维度灾难”[9]和分类精度较低的问题. 基于支持向量机(SVM)、随机森林算法(RF)和主成分分析(PCA)等机器学习的方法很好地解决了上述问题. 其中基于支持向量机的方法在高维数据和小样本数据上的表现非常良好, 在土地类别的判别[10]中有广泛应用. 但是这些方法非常依赖于手动设计特征的质量, 只能学习到遥感场景图像的浅层特征, 容易忽略其丰富的深层特征, 导致分类精度不高.

随着深度学习的兴起, 遥感技术与深度学习分类器结合的方法[11]能够学习到图像蕴含的更深层次特征, 从而解决了传统的遥感图像分类方法只能学习到浅层特征的问题, 使得分类精度得到一定的提升. 自AlexNet[12]被提出以来, 卷积神经网络凭借着高效精准的捕获语义信息的能力, 备受计算机视觉领域的关注. Hu等人[13]采用一维卷积神经网络对光谱信息进行深层次特征提取, 但是由于忽略了空间信息, 导致分类精度不高. Duan等人[14]将卷积神经网络和超像素算法相结合, 以增强局部区域的平滑特性, 从而获取更丰富的空间信息; Wang等人[15]将卷积提取的特征通过主成分分析降维, 并获取到具有层次化特点的全局特征, 同时融合底层和中层特征, 从而形成具有判别性特征的图像数据, 以捕捉重要的空间信息.

以上方法在训练微调过程中要求输入图像具有固定尺寸, 这种过程会丢失重要的空间信息, 导致提升分类精度的效果不明显. 为解决此类问题, Xie等人[16]提出了一种无尺度的CNN, 以达到保留高分辨率遥感图像中关键空间信息的目的. Liu等人[17]设计了一种多尺度的CNN, 构建了一种包含固定尺度网络和可变尺度网络的双分支网络结构来融合不同空间的特征信息. 为了使模型有更好的空间信息捕获能力, 许多研究者将Transformer用到图像识别任务中. Roy等人[18]提出了一种基于LiDAR数据的多模态融合变化器网络, 该方法在高光谱遥感图像分类任务中具有良好的表现. 金传等人[19]提出了将CNN与Transformer相融合的网络, 该方法利用坐标注意力定位到最感兴趣的区域, 在遥感场景分类中取得了良好的效果; Touvron等人[20]构建了一种具有残差结构的多层感知机(MLP), 在图像的输入和末尾分别添加两个残差连接, 使每个模块相对独立, 提高了模型对特征的表达能力. 以上基于Transformer的分类网络能够取得良好的分类效果得益于Transformer拥有强大的上下文语义信息捕捉能力. 但是, Zhu等人[21]验证了视觉转换器(Vision Transformer)[22]在小规模数据集上的性能不佳, 除此之外, 基于Transformer的模型复杂度较大, 处理视觉任务的时间较长, 容易丢失局部语义信息.

在遥感场景分类任务中, 为了能更快速并且精准地定位到重要的特征, 受到以上文献的启发, 本文构建FasterNet[23]与坐标注意力[24]相结合的混合网络. 本文的贡献如下.

(1)对FasterNet中的部分卷积进行改进, 融合点卷积, 构建改进的部分卷积模块, 对特征采取部分提取的策略, 减少内存访问次数, 提高了分类速度.

(2)建立双分支的混合注意力模块, 一个分支对卷积模块提取到的特征进行水平和垂直方向的聚集, 另一分支建立通道注意力聚集特征, 通过两个分支特征的融合, 增加了与任务相关的空间特征信息, 从而提高分类精度.

(3)将部分卷积和注意力机制进行残差融合, 以解决嵌入注意力机制增加模型复杂度所导致的梯度消失问题.

1 本文模型 1.1 本文模型结构

本文研究的基础模型是FasterNet, 其结构如图1所示, 采用部分卷积的策略, 虽然避免了深度可分离卷积在提取特征过程中由于过多的内存访问而带来的冗余计算, 但是忽略了另一部分特征图中的重要信息, 从而影响整体模型的分类精度.

FasterNet模型缺少位置编码、窗口移动和相对编码等操作, 处理视觉任务的计算量较小并且时间短. 整个FasterNet的结构和Swin Transformer[25]的结构类似, 堆叠基础模块的次数为4次.

在FasterNet模型基础之上, 考虑到遥感场景图像具有复杂的纹理特征, 对FasterNet block进行拆分并建立更深层次特征提取模块, 分别是部分卷积模块和双分支注意力模块, 两个模块之间通过残差模块连接, 以增强模型对特征的表达能力, 如图2所示.

图 1 FasterNet模型图

图 2 本文模型图

模型主要由Embedding层, 十字型卷积模块(crossing convolution module)、双分支注意力模块(dual branch attention module)、Merging层和Classifier层组成. Embedding层将图像切分成均匀的块, 高效地提取图像信息, 并经过归一化层(batch normalization, BN)处理, 将离散的图像数据转为连续的向量序列, 最终输出对应的特征图, 从而提高模型的稳定性; 十字型卷积层和双分支注意力层对得到的特征图进行快速并精准地提取, 得到目标图像的重要特征; Merging层将输入的原始图像数据增加通道数以降低分辨率, 同时划分若干个均匀的块, 对每个块进行归一化操作, 保留了原始图像的特征, 减小了重要特征信息的损失; Classifier层接收到最终的特征图后, 得到与类别相关的特征向量, 将得到的特征向量输入到全连接层, 得到类别的数值向量.

1.2 十字型卷积模块

深度可分离卷积是卷积神经网络的一个流行变体, 在神经网络基础模块的构建中得到了应用. 比如Mobile-Net[26,27]、ConvNeXt[28]、ShuffleNet[29,30]等. 除了上述基于纯卷积神经网络的架构之外, 还有新型的架构是基于视觉转换器, 例如MobileVit[31], 结合深度可分离卷积和改进的注意力机制降低纯Transformer的计算复杂度. 然而, 这些模型存在深度可分离卷积增加内存访问和重复的冗余计算的问题.

具体来说, 如图3所示, 深度可分离卷积对于输入$ I \in {\mathbb{R}^{c \times h \times w}} $, 需应用c个滤波器$ W \in {\mathbb{R}^{k \times k}} $, 每个滤波器在一个通道上进行空间滑动, 最后输出$ O \in {\mathbb{R}^{c \times h \times w}} $, 得到的FLOPs为$ h \times w \times {k^2} \times c $. 与图4普通卷积使用相同参数的滤波器后的FLOPs为$ h \times w \times {k^2} \times c $相比, 减少了FLOPs. 但用深度可分离卷积来代替普通卷积, 会导致精度的下降. 因此在实际应用中, 通过将深度可分离卷积的通道数增加到$ {c'} $($ {{c}'}{ > c} $)以补偿损失的准确率. 例如, ConvNeXt将深度可分离卷积的通道数扩大到原来的4倍, 即$ {c'}t{=4c} $. 此时的FLOPs增加到了$ h \times w \times {k^2} \times {c'} $. 对于FasterNet所提出的部分卷积, 如图5所示, 它只对输入通道的一部分采用普通卷积来进行特征提取, 其余部分采用恒等映射. 对于连续的$ {c}_{{p}} $通道, 其FLOPs为:

$ h \times w \times k^2 \times c_p^2 $ (1)

其中, $ {c}'{=4}{c} $, $r$ $({r} > 1)$为倍率因子. 如本文中$r = 4$, 其FLOPs仅为普通卷积的$1/16$. 余下的$ {c-}{{c}}_{{p}} $个通道的FLOPs计算量如式(2)所示:

$ h \times w \times c \times\left(c-c_{p}\right) $ (2)

总的FLOPs如式(3)所示:

$ h \times w \times c \times\left(k^{2} \times c_{p}^{2}+\left(c-c_{p}\right)\right) $ (3)

为了更有效地提取到遥感场景的纹理特征, 将剩余的通道采用点卷积, 在部分卷积的基础之上, 扩大感受野, 图6(a)为本文所采用的十字型卷积模块流程图. 由于文中采用的卷积提取模块由一种点卷积加部分卷积再加点卷积构成, 整个形式呈现出“十字型”.

图 3 深度可分离卷积

图 4 普通卷积

图 5 部分卷积

图 6 本文十字型卷积模块流程图

为确定本文十字型卷积模块中部分卷积中参数k的大小, 选择常用的1×1、3×3、5×5、7×7和9×9共5种不同大小的卷积核大小进行实验, 随机选取10%的NWPU-RESISC45为训练样本, 实验结果见表1.

表 1 十字形卷积模块中参数k在数据集上的分类结果 (%)

表1所知, 十字形卷积模块在参数k选择5×5 时取得了最好的效果, 达到了77.3%, 因此本文十字型卷积中的卷积核k大小为5×5.

图7所示残差模块, 受残差模块[26]的启发, 本文模型先用1×1卷积进行降维, 然后进入部分卷积模块, 最后采用1×1卷积进行升维, 3个过程以及总共的FLOPs如式(4)–式(7)所示:

$ h \times w \times c_{p}^{2} $ (4)
$ h \times w \times c_{p} \times\left(k^{2} \times \frac{c_{p}^{2}}{4}+\frac{c_{p}}{2}\right) $ (5)
$ h \times w \times c^{2} $ (6)
$ h \times w \times c^{2} \times\left(\frac{k^{2} c}{4 r^{3}}+\frac{1}{2 r^{2}}\right) $ (7)

根据式(3)得式(8):

$ h \times w \times c^{2} \times\left(\frac{k^{2} c}{r^{2}}+r-1\right) $ (8)

显然, 对比式(7)和式(8), 本文的十字型卷积模块运行后的FLOPs比部分卷积更少.

图 7 残差模块

1.3 双分支注意力模块

图8为坐标注意力模块的结构示意图. 坐标注意力模块不仅考虑了每个通道的重要性, 而且考虑了空间位置信息, 通过嵌入坐标信息和生成坐标注意力两个步骤, 编码感兴趣区域的精确位置信息通道关系和依赖关系.

图 8 CA结构

本文着重考虑通道关系, 在坐标注意力的基础上进一步考虑通道特征与感兴趣区域的依赖关系, 增加另一条嵌入通道处的分支, 最终形成了具有通道与CA的双分支混合注意力模型, 其结构如图9所示.

图 9 本文嵌入通道与CA的双分支注意力结构图

全局平均池化常用于通道注意力对空间信息的编码, 其流程是将全局空间信息进行压缩, 保留其重要的位置信息. 为了定位到注意力模块在空间上捕获的位置信息, 将全局池化分解成如式(9)所示的一对一维度的特征编码操作.

$ {\textit{z}}_c=\frac{1}{H\times W}{\displaystyle \sum _{i=1}^{H}{\displaystyle \sum _{j=1}^{W}x_c}}(i, j)$ (9)

具体来说, 给定输入$ X $, 使用了两个维度的池化核(H, 1)和(1, W), 分别沿着水平坐标和垂直坐标对每个通道进行编码. 在高度h处的第c通道的输出可以表示为式(10). 类似地, 宽度为w处的第c个通道的输出可以表示为式(11).

$ {{\textit{z}}}_{c}^{h}(h)=\frac{1}{W}{\displaystyle \sum _{0\leqslant i < \text{W}}{x}_{c}}(h, i)$ (10)
$ {{\textit{z}}}_{c}^{w}(w)=\frac{1}{H}{\displaystyle \sum _{0\leqslant j < H}{x}_{c}}(j, w)$ (11)

通过这两种变换方式使注意力模块能够在捕获到物体之间在一个空间方向上的依赖关系的同时, 保留另一空间方向上的位置信息, 有助于网络能更准确地定位到图像上感兴趣的区域.

给定由上述输入X, 通过式(10)和式(11)产生的特征映射, 将它们进行拼接, 形成聚合特征图, 然后输入到1×1的卷积函数F1, 如式(12)所示. 在另一条分支上的通道处的特征输入到1×1的卷积函数F1进行压缩, 如式(13)所示.

$ f=\delta ({F}_{1}([{{\textit{z}}}^{h}, {{\textit{z}}}^{w}])) $ (12)
$ v=\delta ({F}_{1}^{c/r}({{\textit{z}}}_{c}))$ (13)

其中, [·, ·]表示表示沿空间方向的拼接操作, $ \delta $是非线性激活函数, $ f \in {\mathbb{R}^{C/r \times W}} $表示在水平和垂直方向的空间信息编码后的中间特征图, r是控制块缩放比. 然后将f沿着水平和垂直两个空间维度分裂成$ {f^h} \in {\mathbb{R}^{C/r \times W}} $$ {f^h} \in {\mathbb{R}^{C/r \times W}} $. 利用1×1的卷积FhFwFc, 分别将$ {f^h} $$ {f^w} $v变换为与输入X相同通道数的张量, 如式(14)–式(16)所示.

$ {g}^{h}=\sigma ({F}_{h}({f}^{h}))$ (14)
$ {g}^{w}=\sigma ({F}_{w}({f}^{w}))$ (15)
$ {g}^{c}=\sigma ({F}_{c}(v))$ (16)

$\sigma $为激活函数, 然后将ghgwgc分别作为水平、垂直方向以及通道处的的注意力权重.

混合注意力块Y的输出如式(17)所示:

$ {y}_{c}(i, j)={g}^{c}(i, j)\times {g}_{c}^{h}(i)\times {g}_{c}^{w}(j) $ (17)

不同于CA模块仅考虑了物体的空间信息和依赖关系, 本文的双分支注意力加强了物体的空间信息与物体之间的依赖关系. 综上所述, 这种编码过程使得双分支注意力模块能够更精准地定位到物体的位置以及表达出物体之间的依赖关系, 从而能帮助更好地完成计算机视觉任务.

2 模型训练与结果分析 2.1 实验环境与配置

进行本文实验的训练与测试环境均为Windows 10操作系统, 使用PyTorch深度学习框架完成整个模型的训练与测试过程, 调用timm库完成对比实验, 实验环境的具体参数如表2所示.

表 2 实验环境配置表

2.2 实验数据集

为检验本文方法的有效性和泛化能力, 在公开的高分辨率遥感数据集EuroSAT[32]、NWPU-RESISC45[33]以及VArcGIS[34]上开展对比与消融实验; 其中, EuroSAT是遥感场景领域常用的数据集; VArcGIS与EuroSAT相比, 场景类别和地物目标更加丰富, 具有更大的挑战性; NWPU-RESISC45遥感图像数据集拥有45个类别, 场景类别非常丰富, 类间的相似度较高, 是目前遥感场景领域最具挑战性的数据集; 3个数据集的特征与部分场景实例如表3图10所示.

表 3 实验数据集特征

图 10 3种数据集部分场景实例

2.3 训练参数与评价指标

本文选择带有权重的Adam算法, 与传统的Adam相比, 加有惩罚项的Adam在更准确地控制权重衰减强度的同时避免了梯度计算的影响, 可以减少过拟合的风险, 避免陷入局部最优, 从而使得模型更容易收敛. 学习率衰减方式为余弦退火, 输入网络的批量大小为16, 模型的迭代次数为300, 考虑到模型训练刚开始时, 受到学习率的影响导致模型的不稳定, 因此选择预热学习率的方式, 模型的训练参数如表4所示.

为了评价模型的有效, 实验采用总体精度(overall accuracy, OA)和标准差作为评价指标. 总体精度定义为分类正确的样本数占总体样本的比率. 计算公式如下:

$ O A=\frac{T}{T+F} $ (18)

其中, T为正确样本的个数, F为错误样本的个数.

表 4 模型训练参数

标准差的定义是N个数方差的算数平方根, 用于描述数据分布离散程度的一种统计量, 计算公式如下:

$ \bar{B}=\frac{1}{N} \sum_{i=1}^{N} B_{i} $ (19)
$ \tau=\sqrt{\frac{1}{N} \sum_{i=1}^{N}\left(B_{i}-\bar{B}\right)^{2}} $ (20)

其中, Bi表示第i次实验的精度, $ \bar B $表示N次实验的平均精度. 标准差越小表示越稳定.

2.4 对比实验 2.4.1 模型性能对比实验

为验证模型的有效性, 实验的模型参数均保持一致. 其次, 为了避免实验数据的差异带来的影响. NWPU-RESISC45数据集与EuroSAT数据集的训练集、测试集和验证集分别为50%、30%和20%; VArcGIS数据集与文献[35]保持一致, 随机选取10%和20%的场景为训练集, 其余为测试集. 所对比的模型包括现有的遥感场景分类模型GoogLeNet、ConvNeXt、ResNet50、SDCASA[36]、SCRSISC[37]、Vision Transformer[35]、CNN+Transformer+CA[19]. 其中, SDCASA是一种基于自蒸馏级联注意力机制的遥感场景分类方法; SCRSISC是一种基于ResNet监督对比学习的遥感场景分类方法; Vision Transformer是视觉转换器在遥感场景分类领域的应用; CNN+Transformer+CA是一种基于CNN与Transformer结构的分类网络. 实验结果如表5所示.

表5可知, 本文模型在NWPU-RESISC45数据集上的平均精度为96.12%, 在EuroSAT数据集上的平均精度为98.64%, 在训练占比为10%和20%的VArcGIS数据集上平均精度分别为95.42%和97.84%, 均超过了现有的主流模型.

表 5 不同模型在3种数据集上的实验结果对比

2.4.2 热力图对比实验

为验证模型定位重要特征的能力, 对生成模型的特征图上设计热力图实验, 如图11所示, 其中图11(a)–图11(c)分别为河流、海滩、人行横道, 本模型能够精准定位到图像中最感兴趣的区域.

2.4.3 收敛性对比实验

为验证本文方法的收敛性, 使用本文方法与FasterNet在分别在VArcGIS数据集上进行实验, 并分别绘制训练收敛曲线与测试收敛曲线对比, 收敛曲线图如图12图13所示.

图 11 本文模型与其他模型的热力图对比

图 12 VArcGIS数据集上收敛性对比图

图12可知, 在训练实验过程中, 本文模型的准确率均约为99%, 损失约为3.7. 从训练实验过程可以看出本文模型能更快地趋于收敛.

图13所知, 在测试实验过程中, 本文模型的收敛时的准确率约为95%, 损失值约为3, 模型表现略优于FasterNet模型.

2.5 消融实验

为了验证十字型卷积模块捕捉底层特征的能力和双分支注意力定位物体位置信息的效果, 本节实验从50%占比的NWPU-RESISC45和EuroSAT数据集以及10%以及20%占比的VArcGIS数据集作为训练集, 其余为测试集, 进行300次迭代. 其中①为去掉FasterNet block的FasterNet模型. 在实验环境、图像预处理方式和网络超参数等条件相同的情况下进行实验, 结果如表6所示.

表6可知, 单独加入十字型卷积模块和双分支注意力的方法在精度上均得到了提升. 十字型卷积模块主要用于降低内存访问次数, 提高运行速度, 与FasterNet模型相比, 平均一张图像的推理时间少了约0.4 ms. 双分支注意力加强了特征的表达能力, 实验结果表明, 与CA注意力相比, 在NWPU-RESISC45数据集上的精度提高了0.81%, EuroSAT数据集上的精度提高了0.97%, 10%和20%训练占比的VArcGIS数据集上的精度分别提高了0.98%和1.69%. 这验证了双分支注意力定位感兴趣区域和建立通道之间的依赖关系的能力. 综合来看, 同时加入十字型卷积和双分支注意力的模型与基础模型相比, 在NWPU-RESISC45数据集上的精度提高了5.18%, 在EuroSAT数据集上的精度提高了1.65%, 10%和20%训练占比的VArcGIS数据集上的精度上分别提高了6.94%和3.39%. 相比于单独使用一个方法提升更多, 由此说明两个方法均可以提升模型的性能.

图 13 VArcGIS数据集上测试收敛性对比图

2.6 结果与分析

混淆矩阵常用于机器学习和统计学中用于评估分类模型性能的一种方法. 本文使用混淆矩阵来可视化最终的分类结果, 如图14图17所示, 分别表示模型在EuroSAT数据集、NWPU-RESISC45数据集、10%的训练占比的VArcGIS数据集和20%的训练占比的VArcGIS数据集的分类结果. 可以看出, 本文设计的模型分类性能较好, 在3个数据集上均取得了95%以上的准确率.

表 6 消融实验结果

图14是EuroSAT验证集的混淆矩阵, 数字0–9分别代表年作物、森林、草本植物、公路、工业区、牧场、农作物、住宅区、河流和湖泊. 由图14可知, 10个类别的分类精度均达到了95%以上, 分类精度最低的类别是住宅区, 达到了95.84%. 总体而言, 各个类别的分类精度比较平衡, 这是因为场景类别比较少.

图 14 本文模型在EuroSAT验证集上的混淆矩阵

图15为NWPU-RESISC45验证集的混淆矩阵, 数字0–44分别代表飞机、机场、棒球场、篮球场、海滩、桥梁、灌木丛、教堂、圆形耕地、云、商业区、密度住宅区、沙漠、林地、公路、高尔夫球场、田径场、港口、工业区、交叉路口、岛屿、湖泊、草地、中型住宅区、活动房区、山脉、立交桥、宫殿、停车场、铁路、火车站、矩形耕地、河流、环岛、跑道、海冰、船舶、雪山、稀疏住宅区、体育场、储罐、网球场、梯田、火力发电站和湿地. 由图5可知, 36个类别的分类精度达到了95%及以上, 42个类别的分类精度达到了90%及以上; 其中, 教堂和宫殿是容易混淆的两个类别, 12.14%的教堂被错分为宫殿, 7.14%的宫殿被错分为教堂, 这是因为这两类具有结构特征相似度高, 建筑风格类似的特点.

图16图17分别是不同训练比的VArcGIS验证集的混淆矩阵, 数字0–37分别代表飞机、棒球场、篮球场、海滩、桥、墓地、灌木丛、农场、封闭道路、海边豪宅、人行横道、密集住宅、客轮码头、足球场、森林、高速公路、高尔夫球场、港口、路口、移动家庭公园、疗养院、油气田、油井、立交桥、停车场、车位、铁路、河流、跑道、跑道标记、船场、太阳能板、稀疏住宅、储水箱、游泳池、网球场、变压器和污水处理厂.

图16可知, 33个类别的分类准确率达到了90%以上, 22类场景的识别准确率达到了95%以上; 其中, 篮球场和网球场是容易混淆的两个类别, 5.43%的篮球场被错分为网球场, 6.47%的网球场被错分为篮球场, 这是因为这两类球场的背景特征极为相似, 球场建筑风格较为相同. 由图17可知, 38个类别的分类精度达到了90%及以上, 34个类别的分类精度达到了95%及以上; 分类精度最低的类别是篮球场, 达到了93.07%; 由图16图17可知, 扩大训练集的比例可以有效提高各个类别的分类精度, 有效缓解分类精度不平衡、类别被错分的问题.

3 结束语

本文针对遥感场景分类方法运行效率低和遥感场景图像类别多且相似度高导致的难分类问题, 本文从控制卷积提取特征过程中的运算量、模型定位感兴趣区域和计算不同通道处的权重关系出发, 提出残差模块优化部分卷积的策略提取特征以降低卷积运算量, 提高运行效率, 减少运行时间, 采用双分支注意力模块, 一条分支定位到重要的特征, 另一条分支建立通道间的依赖关系. 在NWPU-RESISC45、EuroSAT、VArcGIS这3种遥感场景数据集上开展对比实验以及一系列的消融实验, 分析实验结果, 证明了本文模型的有效性.

图 15 本文模型在NWPU-RESISC45验证集上的混淆矩阵

图 16 本文模型在VArcGIS (10%)验证集上的混淆矩阵

图 17 本文模型在VArcGIS (20%)验证集上的混淆矩阵

然而, 本文方法依然存在很多不足, 从消融实验可以得知, 虽然双分支注意力机制拥有一定的定位重要特征的能力, 但推理时间较长, 有很大的运行代价, 导致本模型优化运行速度的能力有限. 从热力图对比实验可知, 本文模型虽然能够定位到重要的特征, 但是不够集中, 依然无法有效区分相似高的特征的场景类. 因此, 后续将针对区分相似度高的场景类的问题和设计更快速地定位特征的模型是下一步重点研究方向.

参考文献
[1]
Máttyus G, Luo WJ, Urtasun R. DeepRoadMapper: Extracting road topology from aerial images. Proceedings of the 2017 IEEE International Conference on Computer Vision. Venice: IEEE, 2017. 3458–3466.
[2]
Martha TR, Kerle N, van Westen CJ, et al. Segment optimization and data-driven thresholding for knowledge-based landslide detection by object-based image analysis. IEEE Transactions on Geoscience and Remote Sensing, 2011, 49(12): 4928-4943. DOI:10.1109/TGRS.2011.2151866
[3]
Longbotham N, Chaapel C, Bleiler L, et al. Very high resolution multiangle urban classification analysis. IEEE Transactions on Geoscience and Remote Sensing, 2012, 50(4): 1155-1170. DOI:10.1109/TGRS.2011.2165548
[4]
Kim M, Madden M, Warner TA. Forest type mapping using object-specific texture measures from multispectral Ikonos imagery: Segmentation quality and image classification issues. Photogrammetric Engineering & Remote Sensing, 2009, 75(7): 819-829.
[5]
Ghosh R, Jia XW, Kumar V. Land cover mapping in limited labels scenario: A survey. arXiv:2103.02429, 2021.
[6]
骆剑承, 王钦敏, 马江洪, 等. 遥感图像最大似然分类方法的EM改进算法. 测绘学报, 2002, 31(3): 234-239. DOI:10.3321/j.issn:1001-1595.2002.03.010
[7]
朱建华, 刘政凯, 俞能海. 一种多光谱遥感图象的自适应最小距离分类方法. 中国图象图形学报, 2000, 5(1): 21-24. DOI:10.3969/j.issn.1006-8961.2000.01.005
[8]
Foody GM, Mathur A. A relative evaluation of multiclass image classification by support vector machines. IEEE Transactions on Geoscience and Remote Sensing, 2004, 42(6): 1335-1343. DOI:10.1109/TGRS.2004.827257
[9]
Chen YS, Lin ZH, Zhao X, et al. Deep learning-based classification of hyperspectral data. IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing, 2014, 7(6): 2094-2107. DOI:10.1109/JSTARS.2014.2329330
[10]
Avramović A, Risojević V. Block-based semantic classification of high-resolution multispectral aerial images. Signal, Image and Video Processing, 2016, 10(1): 75-84. DOI:10.1007/s11760-014-0704-x
[11]
Szegedy C, Liu W, Jia YQ, et al. Going deeper with convolutions. Proceedings of the 2015 IEEE Conference on Computer Vision and Pattern Recognition. Boston: IEEE, 2015. 1–9.
[12]
Krizhevsky A, Sutskever I, Hinton GE. ImageNet classification with deep convolutional neural networks. Proceedings of the 25th International Conference on Neural Information Processing Systems. Lake Tahoe: Curran Associates Inc., 2012. 1097–1105.
[13]
Hu W, Huang YY, Wei L, et al. Deep convolutional neural networks for hyperspectral image classification. Journal of Sensors, 2015, 2015: 258619.
[14]
Duan YP, Liu F, Jiao LC, et al. SAR image segmentation based on convolutional-wavelet neural network and Markov random field. Pattern Recognition, 2017, 64: 255-267. DOI:10.1016/j.patcog.2016.11.015
[15]
Wang GL, Fan B, Xiang SM, et al. Aggregating rich hierarchical features for scene classification in remote sensing imagery. IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing, 2017, 10(9): 4104-4115. DOI:10.1109/JSTARS.2017.2705419
[16]
Xie J, He NJ, Fang LY, et al. Scale-free convolutional neural network for remote sensing scene classification. IEEE Transactions on Geoscience and Remote Sensing, 2019, 57(9): 6916-6928. DOI:10.1109/TGRS.2019.2909695
[17]
Liu YF, Zhong YF, Qin QQ. Scene classification based on multiscale convolutional neural network. IEEE Transactions on Geoscience and Remote Sensing, 2018, 56(12): 7109-7121. DOI:10.1109/TGRS.2018.2848473
[18]
Roy SK, Deria A, Hong DF, et al. Multimodal fusion Transformer for remote sensing image classification. IEEE Transactions on Geoscience and Remote Sensing, 2023, 61: 5515620.
[19]
金传, 童常青. 融合CNN与Transformer结构的遥感图像分类方法. 激光与光电子学进展, 2023, 60(20): 2028006.
[20]
Touvron H, Bojanowski P, Caron M, et al. ResMLP: Feedforward networks for image classification with data-efficient training. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2023, 45(4): 5314-5321.
[21]
Zhu HR, Chen BY, Yang C. Understanding why ViT trains badly on small datasets: An intuitive perspective. arXiv:2302.03751, 2023.
[22]
Dosovitskiy A, Beyer L, Kolesnikov A, et al. An image is worth 16x16 words: Transformers for image recognition at scale. Proceedings of the 9th International Conference on Learning Representations. OpenReview.net, 2021.
[23]
Chen JR, Kao SH, He H, et al. Run, don’t walk: Chasing higher FLOPs for faster neural networks. Proceedings of the 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Vancouver: IEEE, 2023. 12021–12031.
[24]
Hou QB, Zhou DQ, Feng JS. Coordinate attention for efficient mobile network design. Proceedings of the 2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Nashville: IEEE, 2021. 13708–13717.
[25]
Liu Z, Lin YT, Cao Y, et al. Swin Transformer: Hierarchical Vision Transformer using shifted windows. Proceedings of the 2021 IEEE/CVF International Conference on Computer Vision. Montreal: IEEE, 2021. 9992–10002.
[26]
Howard AG, Zhu ML, Chen B, et al. MobileNets: Efficient convolutional neural networks for mobile vision applications. arXiv:1704.04861, 2017.
[27]
Sandler M, Howard A, Zhu ML, et al. MobileNetV2: Inverted residuals and linear bottlenecks. Proceedings of the 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Salt Lake City: IEEE, 2018. 4510–4520.
[28]
Liu Z, Mao HZ, Wu CY, et al. A ConvNet for the 2020s. Proceedings of the 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE, 2022. 11966–11976.
[29]
Ma NN, Zhang XY, Zheng HT, et al. ShuffleNet V2: Practical guidelines for efficient CNN architecture design. Proceedings of the 15th European Conference on Computer Vision. Munich: Springer, 2018. 122–138.
[30]
Zhang XY, Zhou XY, Lin MX, et al. ShuffleNet: An extremely efficient convolutional neural network for mobile devices. Proceedings of the 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Salt Lake City: IEEE, 2018. 6848–6856.
[31]
Mehta S, Rastegari M. MobileViT: Light-weight, general-purpose, and mobile-friendly Vision Transformer. Proceedings of the 10th International Conference on Learning Representations. OpenReviw.net, 2022.
[32]
Helber P, Bischke B, Dengel A, et al. EuroSAT: A novel dataset and deep learning benchmark for land use and land cover classification. IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing, 2019, 12(7): 2217-2226. DOI:10.1109/JSTARS.2019.2918242
[33]
Cheng G, Han JW, Lu XQ. Remote sensing image scene classification: Benchmark and state of the art. Proceedings of the IEEE, 2017, 105(10): 1865-1883. DOI:10.1109/JPROC.2017.2675998
[34]
Hou DY, Miao ZL, Xing HQ, et al. V-RSIR: An open access Web-based image annotation tool for remote sensing image retrieval. IEEE Access, 2019, 7: 83852-83862. DOI:10.1109/ACCESS.2019.2924933
[35]
Bazi Y, Bashmal L, Rahhal MMA, et al. Vision Transformers for remote sensing image classification. Remote Sensing, 2021, 13(3): 516. DOI:10.3390/rs13030516
[36]
宋冠武, 陈知明, 李建军. 基于ResNet-50的级联注意力遥感图像分类. 广西师范大学学报(自然科学版), 2023, 41(6): 80-91.
[37]
郭东恩. 基于深度学习的遥感图像场景分类研究 [博士学位论文]. 重庆: 重庆邮电大学, 2021.