随着无人机(unmanned aerial vehicle, UAV)相关技术的不断深入研究, 其应用场景不断扩展, 由于无人机具有低成本、轻便快速的特点[1], 被广泛应用于工农业、抢险救灾、遥感图像和视频录制等实际行业领域, 它是卫星遥感的有力补充[2]. 无人机的理想摄影平台是低空航空拍摄, 利用高清传感器可以捕捉地面目标, 所拍摄的图像分辨率较高. 在云层不影响图像拍摄的低空飞行状态下, 无人机使用高清摄像头拍摄所获得的图像可以达到厘米级别的分辨率[3]. 但相对来说, 在大多数的无人机航拍图像中, 由于较高的拍摄高度, 无人机距离地面较远, 图像中的各个类别的待检测目标对象呈现出小目标的特点, 如人、摩托车、自行车等, 小目标往往特征单一, 像素比较低, 检测过程中容易出现漏检或者误检等不足之处. 背景复杂, 存在着目标遮挡, 光线不足、相似形状物体干扰等因素的干扰[4]. 因此提高无人机航拍图像中小目标的检测精度已成为目标检测中一个具有挑战性的研究方向.
传统的目标检测算法很难提取到足够好的特征来进行检测, 而深度学习的快速发展极大地推动了目标检测技术的前进, 在一定程度上改变了人类的生活方式, 减轻了人们的负担. 基于深度学习的目标检测算法, 可以根据其模型训练方式特点大致分为单阶段(one-stage)目标检测算法和二阶段(two-stage)目标检测算法两类. 二阶段目标检测算法的代表为R-CNN[5]、Fast R-CNN[6]、Faster R-CNN[7]、R-FCN[8], 此类算法基于区域提取, 对候选区域进行位置精修和类别分类, 逐步优化, 虽然其检测精度略高, 但该类算法的检测流程相对复杂, 检测速度普遍较慢. 不适合应用于对实时性要求较高的场景中. 单阶段目标检测算法采用了回归思想的端到端的目标检测, 相比于二阶段目标检测算法, 单阶段目标检测算法起步较晚, 能够更好地吸收前者的优势, 同时克服不足之处. 其主要代表是SSD (single shot multibox detector)系列[9]、YOLO (you only look once)系列[10–13]和 RetinaNet系列[14], 此类检测算法精度略低, 但其检测速度很快, 广泛应用于工业界.
近些年来, 单阶段目标检测算法YOLO系列不断改进, 模型检测精度有了很大提升, 被广泛应用于无人机图像检测. 程江川等人[15]采用轻量化高效骨干网络对模型进行改进, 提高模型检测速度. 李利霞等人[16]提出浅层特征增强模块, 并设计多级特征融合模块, 动态调节各输出检测层的权重, 增强小目标特征信息. 韩俊等人[17]提出了LSA_YOLO模型, 构造多尺度特征提取模块, 设计自适应权重动态融合结构, 增强算法对密集小目标的检测能力; 李扬等人[18]以YOLOX为基线算法, 通过多尺度特征融合缩小网络感受野, 提高网络细节提取能力, 提升对小目标图像的敏感程度. 奉志强等人[19]提出了一种改进无人机实时密集小目标检测的算法, 提出一种空间-通道注意力模块, 在主干网络中引入Transformer模块, 提高复杂背景下密集小目标的特征提取能力.
上述算法存在检测能力较弱、模型参数量较大的缺点, 无法快速且准确的检测无人机小目标图像, 为了在实际场景中满足无人机图像小目标检测算法的要求, 精准且迅速地检测出对象目标信息, 选择YOLOv5s 算法为基线算法进行改进, 提出CHD-YOLOv5 模型. 首先在骨干网络部分, 融合CSPNet网络与ConvMixer[20], 将递归门控卷积[21]与C3模块结合构建C3HB模块, 并且替换网络预测头部为精简的解耦头部, 损失函数选用EIoU[22], 最后在VisDrone2019数据集上测试改进后的算法, 得到的实验结果数据表明, 改进后的算法对检测无人机小目标图像的精度值有效提高了, 明显优于原算法.
1 改进的CHD-YOLOv5模型 1.1 YOLOv5网络结构YOLOv5检测算法集合了很多算法的优势, 是一个高效精准的目标检测框架, 该算法有良好的稳定性与适应性, 目前应用最为广泛. YOLOv5算法共有YOLOv5n、YOLOv5s、YOLOv5m、YOLOv5l和YOLOv5x这5个版本, YOLOv5s网络的模型文件只有24M, 除YOLOv5n外, 其他3个版本都在YOLOv5s的基础上对网络不断进行加深与加宽. YOLOv5算法在模型训练阶段使用数据增强方法Mosaic, 通过随机缩放、随机裁剪、随机排布的方式对不同图像进行拼接, 能够有效提高算法对小目标的检测能力. 骨干网络部分, YOLOv5引入了能够直接处理输入图片的Focus结构. 其结构最重要的作用是切片操作, 可以将2×2×3的图像切片为1×1×12的特征图. 网络输出部分: 延续YOLO系列的一贯做法, 与YOLOv3、YOLOv4类似, 采用的预测头部是耦合的Head, 共有3个不同的输出头部, 进行多尺度预测. YOLOv5s较好地平衡了速度与性能, 所以本文的基线模型选择YOLOv5s版本.
1.2 CHD-YOLOv5模型无人机图像存在尺寸较小、容易受环境影响、数量大且目标密集等问题, 为了快速且精准识别无人机小目标图像, 算法改进以YOLOv5s算法为基础. 基于CSPNet构建CSP-ConvMixer模块, 实现模型梯度信息的结合, 增强网络的学习能力, 提升算法性能; 通过引入递归门控卷积与C3模块结合, 明显提高了模型对小目标的高阶空间信息捕获能力, 提升模型的高阶交互能力; 把边框损失函数由CIoU替换为 EIoU, 对预测和真实框之间宽和高的预测结果进行惩罚, 提高收敛速度和边界框定位准确度, 增强模型检测效果; 解耦预测部分的分类任务与回归任务, 加快模型收敛速度. 本文将详细介绍本文所提出CHD-YOLOv5模型, 叙述CHD-YOLOv5模型中改进的网络结构以及针对小目标检测而新设计的模块, 最后将CHD-YOLOv5模型与其他主流模型进行对比, 有效表明本文所提出模型的高效性. 本文模型的网络结构图如图1所示.
|
图 1 改进后的CHD-YOLOv5网络结构 |
1.2.1 CSP-ConvMixer模块
Wang等人[23]提出新型骨干网络CSPNet (cross stage partial network)结构. 该结构能够在降低网络计算量的同时, 获取更丰富的梯度融合信息, 保持甚至提高CNN的能力, 减少内存消耗. CSPNet结构通过将浅层的特征图进行通道拆分, 一部分经由特征提取模块向后传播, 另一部分则采用跨阶段特征融合策略直接与特征提取模块的输出进行合并, 实现了梯度信息的结合, 增强网络的学习能力. CSPNet结构可以与多种网络结构结合, 轻松应用于多数经典CNN模型, 在相同的实验环境下, 可以提高模型的学习能力, 提升算法性能.
ConvMixer是一个只需要使用标准的卷积的patch embedding网络, 通过空间融合(depthwise convolution)和通道融合(pointwise convolution)来减少模型的参数. patch embedding的主要功能是对原始输入图像(h, w)划分图像块. 首先指定每个图像块的size为(patch_size, patch_size), 将每张图像划分出(h/patch_size, w/patch_size)个图像块, kernel size为q, stride为q, 计算公式为式(1)所示:
| $ {\textit{z}}_{0}=B N(\sigma\{\operatorname{Conv}(X, q, q)\}) $ | (1) |
在ConvMixer中, 特征提取层由深度卷积(depthwise conv)、GELU激活函数和逐点卷积(pointwise conv)这3部分组成. 混合分离空间和通道维度, 即先通过一个深度可分离卷积提取图片长宽的特征信息, 再通过一个逐点卷积融合通道信息, 同时在整个过程中, 保证大小和分辨率相同. 与ResNet等 CNN、Swin、AS-MLP 等金字塔结构的分类头一致, 每个卷积之后是一个激活函数和激活后的BatchNorm, 计算公式如下所示:
| $ {\textit{z}}'_{t}=B N\left(\sigma\left\{\text {ConvDepthwise}\left({\textit{z}}_{l}-1\right)\right\}\right)+{\textit{z}}_{l-1} $ | (2) |
| $ {\textit{z}}_{l+1}=B N\left(\sigma\left\{\text {ConvPointwise}\left({\textit{z}}_{l}'\right)\right\}\right) $ | (3) |
Patch embedding通过一次性进行下采样来减少内部分辨率, 有效增加感受野, 从而可以更容易的将远距离空间信息混合. 在patch embedding和多个 ConvMixer layer 之后, 经过全局池化获得特征向量, 再经过全连接层传递进行分类. 实验数据证明, 模型性能上, ConvMixer可以与ResNet等经典模型相比较, 也明显优于VIT和MLP-Mixer等, 且越大的深度可分离卷积核, 其模型的性能提升越强. CSPNet结构应用于 ConvMixer 之后的网络结构如图2所示.
1.2.2 递归门控卷积C3HB模块递归门控卷积模块由门控卷积和递归设计组成, 利用门控卷积和递归设计进行高阶空间交互作用, 具有执行高效、可扩展和平移等变的特点, 可以基于各种视觉Transformer 和基于CNN的模型进行即插即的改进. 空间交互作用是在特征图采样过程中通过额外的或者自身的某种计算, 将空间的相互性加入到生成的特征中, 例如Transformer中就利用不同的变换生成Q和K进而进行空间位置相关性的计算. 高阶空间交互是通过增加通道宽度的设计而高效实现的具有有限复杂性的任意阶空间交互. 通道维度数计算公式如式(4)所示:
| $ C_{k}=\frac{C}{2^{n-k}}, \; k \in(0, n-1) $ | (4) |
|
图 2 CSP-ConvMixer模块 |
门控卷积首先利用两个卷积层来调整特征通道数, 深度可分离卷积的输出特征会沿着特征分为多块, 考虑空间信息交互, 前后两块的特征交互将进一步利用逐元素相乘的方式, 最终得到输出特征. 首先使用线性投影函数
| $ \begin{split} [p_0^{H \times W \times {C_0}}, & q_0^{H \times W \times {C_0}}, \cdots, q_{n - 1}^{H \times W \times {C_{n - 1}}}] = \varphi (x) \\ & \in R_{}^{H \times W \times ({C_0} + {{\sum {} }_{0 \leqslant k \leqslant n - 1}}{C_k})} \end{split} $ | (5) |
以递归的方式进行门控卷积如式(6)所示:
| $ p_{k+1}=f_{k}\left(q_{k}\right) \odot n_{k} / \alpha \; (k=0, 1, \cdots, n-1) $ | (6) |
其中,
YOLOv5算法特征提取部分的CSP结构集成残差组件, 但是由于残差模块无法充分学习特征信息, 缺乏全局信息提取能力, 无法有效检测出无人机小目标图像. 因此, 在YOLOv5算法中引入递归门控卷积. YOLOv5算法主干网络部分的C3模块具有丰富的语义信息, 将最后两个C3模块与递归门控卷积相结合, 构建C3HB(C3-HorBlock)模块, 递归门控卷积C3HB模块的结构图如图3所示. 一般来说, 检测性能越强的模型, 其主干网络提取特征能力越强. 借鉴Transformer结构将HorNet中的递归门控卷积模块gnConv引入, 构建由空间混合层(MLP)和前馈网络(FFN)组成的HorBlock. 替换YOLOv5中的n个残差网络为n个HorBlock, 并引入递归门控卷积模块gnConv替换掉C3模块中的卷积模块, 有效增强了主干网络部分的特征信息提取能力. 该模块的计算量如式(7)所示:
| $ F L O P s=H W C\left(2 K^{2}+11 / 3 \times C+2\right) $ | (7) |
该模块能够在无人机图像小目标检测中通过实现上下文的小目标信息交互而预测其具体位置, 提升模型的高阶交互能力, 它可以逐步通过相邻特征间的信息交互实现高阶特征目标获取, 提高网络对较小目标的敏感度. 在提升网络检测精度的同时, 既避免了过度增加参数量, 又保证了特征信息在送往特征增强网络之前不会丢失目标信息的语义, 有效提高了模型的高阶空间交互能力, 从而增强模型的检测能力.
|
图 3 递归门控卷积C3HB模块 |
1.2.3 精简解耦检测头部OD-Head
众所周知, 目标检测的分类任务和回归任务之间是相互矛盾的. 因此, 大多数一级和二级探测器应用解耦头部, 但是, 由于YOLO系列的主干和特征金字塔不断演化, 从YOLOv3发展到YOLOv5, 原始模型的检测头部是通过分类和回归分支融合共享的方式来实现的, 检测头部仍然是耦合的, 其检测头部结构如图4所示. YOLOX[24]的检测头分别采用两个不同的头解耦输出的特征图, 各自输出分类和位置, 独自解耦分类和回归两个分支, 在提升精度的同时, 有效加快网络收敛速度. 因此解耦头被广泛应用于目标检测算法中.
在YOLOv5的检测头部引入解耦头部的方法, 可以有效提高检测精度, 加速网络的收敛, 本文中提出的YOLOv5中引入的解耦头部也是基于anchor检测的方法, 但与YOLOX解耦头部所使用的检测方法有所不同. YOLOX的解耦头部在提升模型精度的同时, 新增了多个额外的卷积层, 大大增加了延时和参数量, 本文提出了一个更加精简的解耦头部OD-Head, 其检测头部结构如图5所示. OD-Head的添加方式有所不同, 参数量和计算量有明显下降, 在维持精度的同时降低了延时, 缓解了解耦头部中3×3卷积带来的额外延时开销.
|
图 4 YOLOv3–YOLOv5检测头部结构 |
|
图 5 解耦检测头部OD-Head结构 |
1.2.4 EIoU损失函数
目标检测任务的损失函数一般由分类损失函数(classification loss)和回归损失函数(bounding box regression loss)两部分构成, 是目标检测中的常见指标. IoU_Loss主要是通过预测框和真实框的相交区域面积和合并区域面积的比值, IoU的计算公式如式(8)所示:
| $ I o U=\frac{A \cap B}{A \cup B} $ | (8) |
其中, A和B分别表示预测框和真实框, 即IoU值越高, 检测结果越好. 尺度不变性是IoU一个很好的特性, 也就是对尺度不敏感(scale invariant), 在regression任务中, 判断predict box和gt的距离最直接的指标就是IoU. 如果IoU值为0, 即两个目标框没有任何重叠时, 梯度为0, 则IoU无法反映两个目标的精准重合度, 不能优化. 如式(9)所示:
| $ { IoU\_Loss }=1-IoU $ | (9) |
IoU的变体有EIoU、SIoU、GIoU、WIoU等, YOLOv5算法的损失函数为CIoU. CIoU多用于训练, 该损失函数考虑了边界框回归的重叠面积、中心点距离和纵横比, 但当预测框的宽高满足一定条件时, CIoU中此项的惩罚便失去了作用. EIoU考虑了重叠面积、中心距离、长宽边长真实差, 解决了CIoU纵横比的模糊定义. EIoU的计算公式如式(10)所示:
| $ \begin{split} {L_{{\rm{EIoU}}}} & = {L_{{\rm{IoU}}}} + {L_{{\rm{dis}}}} + {L_{{\rm{asp}}}} \\ & = 1 - IoU + \frac{{{p^2}(b, {b^{{\rm{gt}}}})}}{{{c^2}}} + \frac{{{p^2}(w, {w^{{\rm{gt}}}})}}{{c_w^2}} + \frac{{{p^2}(h, {h^{{\rm{gt}}}})}}{{c_h^2}} \end{split} $ | (10) |
其中, c代表的是能够同时包含预测框和真实框的最小闭包区域的对角线距离,
本文实验环境为Windows 11操作系统, 搭载10 vCPU Intel(R) Xeon(R) Gold 5218R CPU@2.10 GHz处理器, 使用RTX3090 (24 GB) GPU进行训练推理, 采用PyTorch 1.9.0版本的深度学习框架, 加速库是CUDA 11.1, 所使用的编程语言为Python 3.8.
2.1 数据集本文实验数据选取VisDrone2019无人机航拍数据集, 该数据集是由天津大学机器学习与数据挖掘实验室的AI SKYEYE团队所收集的, 图像采集于国内14个城市, 由不同类型的无人机在不同的天气情况、不同的场景和不同的光照条件下拍摄, 单张图像中往往包含多种目标信息、大量的小目标, 且目标存在不同程度的遮挡. VisDrone2019数据集共有8629张静态图片, 划分为3个部分, 训练数据集6471张, 验证数据集548张, 和测试数据集1580张. VisDrone2019数据集图像种类包含10类, 分别为: 人、行人、自行车、汽车、卡车、面包车、三轮车、遮阳三轮车、公交车以及摩托车, 数据集共有260万个标注. VisDrone2019数据集中的数据信息如图6所示. 由图6(b)可知, 该数据集中包含大量分布密集的小目标, 符合本文的研究问题.
2.2 评价指标与参数设置本文实验基于YOLOv5s模型进行改进, 初始学习率为0.01, 训练轮数为100 epochs, 优化器为SGD, 数据增强采用Mosaic, 输入图像的分辨率为640×640, 实验选取精确率(precision, P)、召回率(recall, R)、整体平均精度均值 (mAP)、每秒传输帧数(FPS)以及网络的参数量(Params)为评价指标, 通过实验数据对比与分析对算法网络模型进行评估, 其中公式如下所示:
| $ P=\frac{T P}{T P+F P} \times 100 {\text{%}} $ | (11) |
| $ R=\frac{T P}{T P+F N} \times 100 {\text{%}} $ | (12) |
| $ m A P=\frac{\displaystyle\sum \int_{0}^{1} P(R) {\rm{d}} R}{n} \times 100 {\text{%}} $ | (13) |
其中, 式(11)为精确度的计算公式, 式(12)为召回率的计算公式, 式(13)为整体平均精度均值的计算公式, TP、FP和FN分别表示正确检测框、错误检框和漏检框的数量, n表示所有需要检测的类别总数.
|
图 6 VisDrone2019数据信息图 |
2.3 模块对比实验分析 2.3.1 CSP-ConvMixer模块对比分析
本文结合CSPNet和ConvMixer构建的CSP-ConvMixer模块, 实现了更加丰富的梯度组合, 有利于提高模型的学习能力, 仅使用标准卷积来实现混合步骤, 有效扩大感受野, 从而能够更容易的混合远距离的空间信息, 但较金字塔模型相比较, 提高了模型复杂度, 推理速度有所减缓, 实验数据如表1所列. 该模块较基线模型mAP50值提升了5.4%, mAP75值提升了4.1%, 模型精度检测效果提升明显.
2.3.2 递归门控卷积C3HB模块对比分析本文构建的递归门控卷积C3HB模块, 与具有相似的整体架构Swin Transformer和ConvNeXtV2相比, 实验数据如表2所列. 该模块具有空间高阶特征提取能力, 有良好的可扩展性, 能够更好地捕获小目标的细节信息, 增加了模型参数量, 减缓了网络检测速度, 但mAP50和mAP75均有明显提升, 优于Swin Transformer和在ConvNeXt基础上升级的ConvNeXtV2, 证明了该模块对提高模型性能的有效性.
| 表 1 CSP-ConvMixer模块的对比实验 |
| 表 2 递归门控卷积C3HB模块的对比实验 |
2.3.3 解耦头部对比分析
本文提出的基于anchor检测的方法替换预测头部为OD-Head解耦头部, 平均精度均值提升了0.8个百分点, 有效提升网络收敛速度, 并提升模型检测精度; 为了表明本文所设计的OD-Head解耦头部更加具有高效性与实时性, 将OD-Head与YOLOv5的coupled head和YOLOX[24]的decoupled head进行对比实验, 实验数据如表3所列. 与耦合头部相比较, 解耦头部的参数量和浮点运算数有所增加, 同时模型的精度也提高了. 经过优化的OD-Head较YOLOX的decoupled head, 参数量和浮点运算数均有明显的大幅度下降, 平均精度均值却提升了0.3个百分点. 解耦头部的对比试验有效证明了本文提出的OD-Head解耦头部可以在提升模型检测精度的同时减少参数量, 加快网络的收敛速度.
| 表 3 检测头部的对比实验 |
2.3.4 EIoU损失函数对比分析
本文在4种不同损失函数的情况下进行对比实验, 以更进一步验证损失函数EIoU对无人机图像小目标检测的有效性, VisDrone2019 数据集在不同损失函数影响下的检测精度, 实验数据如表4所列. 引入EIoU损失函数后, 模型的mAP50值提升了1.0%. EIoU引入目标框和预测框的长宽信息, 避免了出现中长宽比等比例变化惩罚失效的问题, 加快网络模型的收敛速度, 提高回归精度, 快速定位结果, 更适合于复杂背景下的无人机小目标检测任务.
| 表 4 损失函数的对比实验 (%) |
2.4 消融实验分析
为了直观地体现各方法对网络性能的影响, 验证本文提出4个模块对算法改进的有效性, 即在YOLOv5s算法中增加CSP-ConvMixer模块, 主干网络引入递归门控卷积C3HB模块, 将检测头部(coupled head)替换为解耦头部OD-Head以及使用EIoU损失函数. 消融实验的进行选取完全相同的实验环境, 评估各个模块对模型性能的影响. 实验结果如表5所列. 引入CSP-ConvMixer模块, 平均精度均值提升了3.2个百分点, 验证了该模块的有效性; 将原YOLOv5算法中主干网络部分C3结构的残差网络替换为递归门控卷积C3HB模块, 平均精度均值提升了2.2个百分点, 有效地捕获了高阶空间信息交互能力, 逐步细化了局部信息, 增强了模型的特征信息提取能力和建模能力; 基于anchor检测的方法, 替换预测头部为OD-Head解耦头部, 平均精度均值提升了0.8个百分点, 有效提升网络收敛速度, 并提升模型检测精度; 引入EIoU损失函数, 模型的平均精度均值上升了1.0个百分点, EIoU损失函数在CIoU损失函数的基础上, 分别计算预测框和真实框宽高的差异值, 解决了纵横比的模糊定义, 加快了预测框的收敛速度, 有效提升了小目标检测精度.
| 表 5 消融实验数据表 |
为了更加直观地展示出CHD-YOLOv5算法检测效果的优越性, 选取部分图像进行对比. 考虑到无人机图像易受光线变化影响、小目标密集等特点, 选取具有代表性的4种不同场景图片对传统的YOLOv5模型和改进后的CHD-YOLOv5模型进行检测效果对比. 图7为日常普通简单场景拍摄图片, 图8为大量目标有遮挡的场景, 图9为小目标较为密集的场景, 图10为光线昏暗的夜间场景. (a)组图片为VisDrone2019数据集原始图片, (b)组图片为YOLOv5算法检测效果图, (c)组图片为改进后的CHD-YOLOv5算法检测效果图. 算法的效果图明显展示出在同一场景下, YOLOv5算法容易忽略边缘区域的目标信息, 在有遮挡或小目标密集的位置, 以及光线昏暗的情况下, 出现漏检和误检现象, 而改进后的CHD-YOLOv5模型对小目标的漏检误检情况有所减弱, 且在光线不良的夜间场景下小目标检测效果也有所增强, 提升了模型检测精度. 因此, 改进后的算法检测效果更好, 检测到的目标信息更加细节, 具有良好的鲁棒性, 在无人机图像小目标的检测中更有优势.
|
图 7 简单场景检测效果对比 |
|
图 8 有遮挡场景检测效果对比 |
|
图 9 密集场景检测效果对比 |
|
图 10 夜间场景检测效果对比 |
2.5 模型对比实验分析
为了验证本文改进后算法对无人机图像小目标检测的有效性, 本文在VisDrone2019数据集上采用YOLOv5s-6.2作为基线模型, 与YOLOv5s、YOLOv7-tiny、YOLOv8s、YOLOX和最新的YOLOv8s进行对比试验, 各算法的实验数据如表6所列.
由于VisDrone2019数据集无人机图像分辨率较大, 小目标数量众多, 存在大量形似物, 目标特征极易弱化, 造成漏检错检情况, 检测精度普遍较低, 基线算法mAP50值为27.5%, mAP75值为13.5%, 改进后的CHD-YOLOv5模型mAP50值为35.1%, mAP75值为19.3%, 较基线算法YOLOv5s的mAP50值提升了7.6%, mAP75值提升了5.8%; 与其他模型相比, 较YOLOv7-tiny的mAP50值提升了4.9%, mAP75 值提升了4.1%; 较YOLOX的mAP50值提升了7.4%, mAP75值提升了5.2%; 较YOLOv8s的mAP50值提升了2.4%, mAP75值提升了0.1%; 较Light-RCNN的mAP50值提升了12.5%, mAP75值提升了7.0%; 较Faster-RCNN的mAP50值提升了9.2%, mAP75值提升了5.6%; 较BA-YOLOv5s的mAP50值提升了1.7%. 相比于基线算法YOLOv5s, CHD-YOLOv5模型在个别检测精度较高的类别上, 精度值有略微下降, 但在检测精度较低的小目标数量较多的类别上, 精度值均有提升, 其中单类别精度值提升最大的高达50.31%. 且mAP50值和mAP75值均有明显提升. 相比于其他模型, 虽然本文提出的CHD-YOLOv5模型的模型大小和参数量都有所增加, 但是模型性能有明显增强, 对无人机小目标图像的检测效果更好. 综合各项指标观察, 改进后模型综合性能更好, 有明显的优越性.
| 表 6 不同算法在VisDrone2019测试集上的对比分析 (%) |
2.6 泛化能力测试
为了证明CHD-YOLOv5模型的泛化能力, 另外选取DOTA 1.0数据集和HRSID数据集进行实验. CHD-YOLOv5算法在DOTA 1.0数据集和HRSID数据集的检测结果集如表7所列.
2017年11月28日, 武汉大学在arXiv上发布了DOTA数据集, 2018年6月又在IEEE计算机视觉和模式识别会议(CVPR)上发布了DOTA 数据集. DOTA 1.0是用于航空图像中目标检测的大规模数据集, 共包含图片2806张, 图片来源于Google Earth不同传感器和平台的不同尺度、方向和形状的物体, 图片的像素尺寸在800×800到4000×4000的范围内. DOTA图像的目标类别15个常见类别, 数据集包含由任意四边形标记的188 282个实例. HRSID数据集于2020年1月由电子科技大学发布的, HRSID数据集是用于船舶检测、语义分割和实例分割任务的高分辨率SAR图像数据集, 共包含SAR图像5604张, 完全标注的ship实例16951个. HRSID数据集包括不同分辨率的SAR图像、极化、海况、海域和沿海港口. DOTA 1.0数据集是航空影像图像, 尺度变化性较大, 小目标数量多且分布密集, HRSID数据集是高分辨率舰船图像, 目标单一. 实验数据表明, CHD-YOLOv5算法在DOTA 1.0数据集和HRSID数据集上的检测效果均有提升, CHD-YOLOv5模型具有良好的泛化能力.
| 表 7 CHD-YOLOv5在2个数据集上的实验结果 (%) |
3 结论与展望
由于无人机图像背景复杂、小目标较多, 由于无人机图像小目标检测易出现漏检误检现象, 本文提出了一种高阶深度可分离无人机图像小目标检测算法以增强模型检测效果. 该算法在主干网络部分, 融合ConvMixer与CSPNet结构, 增大模型感受野, 大大提升了模型检测性能; 结合C3模块与递归门控卷积构建C3HB模块, 使模型的高阶空间交互能力提升, 增强了模型的特征信息提取和表达能力, 提高算法对无人机图像小目标的高阶建模能力; 此外, 将YOLOv5算法原本的预测部分替换为精简的解耦头部, 加快网络收敛速度, 提高网络的收敛效果; 最后, 边界框损失函数采用EIoU, 分别对预测和真实框之间宽和高的预测结果进行惩罚, 提高收敛速度和边界框定位准确度, 精确定位检测框. 在VisDrone2019数据集上的实验结果有效表明, 本文所提出的模型有效提升了检测精度, 大大降低了无人机图像小目标的错检率和漏检率, 模型性能提升明显, 但模型的参数量有所增加, 在轻量化方面仍有进步空间, 在以后的工作中, 需继续研究探索如何实现一个实时的高性能检测模型. 本文算法可充分与实际结合, 在工农业、城市规划等实际应用中有较高实用价值.
| [1] |
朱华勇, 牛轶峰, 沈林成, 等. 无人机系统自主控制技术研究现状与发展趋势. 国防科技大学学报, 2010, 32(3): 115-120. DOI:10.3969/j.issn.1001-2486.2010.03.022 |
| [2] |
徐光达, 毛国君. 多层级特征融合的无人机航拍图像目标检测. 计算机科学与探索, 2023, 17(3): 635-645. DOI:10.3778/j.issn.1673-9418.2205114 |
| [3] |
向昌成, 黄成兵, 罗平, 等. 基于YOLO算法的无人机航拍图像车辆目标检测系统研究. 计算机与数字工程, 2021, 49(8): 1566-1570. DOI:10.3969/j.issn.1672-9722.2021.08.012 |
| [4] |
冒国韬, 邓天民, 于楠晶. 基于多尺度分割注意力的无人机航拍图像目标检测算法. 航空学报, 2023, 44(5): 326738. |
| [5] |
Girshick R, Donahue J, Darrell T, et al. Rich feature hierarchies for accurate object detection and semantic segmentation. Proceedings of the 2014 IEEE Conference on Computer Vision and Pattern Recognition. Columbus: IEEE, 2014. 580–587.
|
| [6] |
Girshick R. Fast R-CNN. Proceedings of the 2015 IEEE International Conference on Computer Vision. Santiago: IEEE, 2015. 1440–1448.
|
| [7] |
Ren SQ, He KM, Girshick R, et al. Faster R-CNN: Towards real-time object detection with region proposal networks. Proceedings of the 28th International Conference on Neural Information Processing Systems. Montreal: MIT Press, 2015. 91–99.
|
| [8] |
Wang JL, Luo JX, Liu B, et al. Automated diabetic retinopathy grading and lesion detection based on the modified R-FCN object-detection algorithm. IET Computer Vision, 2020, 14(1): 1-8. DOI:10.1049/iet-cvi.2018.5508 |
| [9] |
Liu W, Anguelov D, Erhan D, et al. SSD: Single shot multibox detector. Proceedings of the 14th European Conference on Computer Vision. Amsterdam: Springer, 2016. 21–37.
|
| [10] |
Redmon J, Divvala S, Girshick R, et al. You only look once: Unified, real-time object detection. Proceedings of the 2016 IEEE Conference on Computer Vision and Pattern Recognition. Las Vegas: IEEE, 2016. 779–788.
|
| [11] |
Redmon J, Farhadi A. YOLO9000: Better, faster, stronger. Proceedings of the 2017 IEEE Conference on Computer Vision and Pattern Recognition. Honolulu: IEEE, 2017. 6517–6525.
|
| [12] |
Redmon J, Farhadi A. YOLOv3: An incremental improvement. arXiv:1804.02767, 2018.
|
| [13] |
Bochkovskiy A, Wang CY, Lia OHM. YOLOv4: Optimal speed and accuracy of object detection. arXiv:2004.10934, 2020.
|
| [14] |
Lin TY, Goyal P, Girshick R, et al. Focal loss for dense object detection. Proceedings of the 2017 IEEE International Conference on Computer Vision. Venice: IEEE, 2017. 2999–3007.
|
| [15] |
程江川, 王伟, 康林, 等. 基于改进YOLOv5与嵌入式平台的多旋翼无人机检测算法. 兵工自动化, 2023, 42(4): 74-78. |
| [16] |
李利霞, 王鑫, 王军, 等. 基于特征融合与注意力机制的无人机图像小目标检测算法. 图学学报, 2023, 44(4): 658-666. |
| [17] |
韩俊, 袁小平, 王准, 等. 基于YOLOv5s的无人机密集小目标检测算法. 浙江大学学报(工学版), 2023, 57(6): 1224-1233. |
| [18] |
李杨, 武连全, 杨海涛, 等. 一种无人机视角下的小目标检测算法. 红外技术, 2023, 45(9): 925-931. |
| [19] |
奉志强, 谢志军, 包正伟, 等. 基于改进YOLOv5的无人机实时密集小目标检测算法. 航空学报, 2023, 44(7): 327106. |
| [20] |
Ng D, Chen YQ, Tian B, et al. Convmixer: Feature interactive convolution with curriculum learning for small footprint and noisy far-field keyword spotting. Proceedings of the 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). Singapore: IEEE, 2022. 3603–3607.
|
| [21] |
Rao YM, Zhao WL, Tang YS, et al. Hornet: Efficient high-order spatial interactions with recursive gated convolutions. Proceedings of the 36th Conference on Neural Information Processing Systems. New Orleans: OpenReview.net, 2022. 10353–10366.
|
| [22] |
Zhang YF, Ren WQ, Zhang Z, et al. Focal and efficient IoU loss for accurate bounding box regression. Neurocomputing, 2022, 506: 146-157. DOI:10.1016/j.neucom.2022.07.042 |
| [23] |
Wang CY, Liao HYM, Wu YH, et al. CSPNet: A new backbone that can enhance learning capability of CNN. Proceedings of the 2020 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops. Seattle: IEEE, 2020. 1571–1580.
|
| [24] |
Ge Z, Liu ST, Wang F, et al. YOLOX: Exceeding YOLO series in 2021. arXiv:2107.08430, 2021.
|
2024, Vol. 33


