Others

Research on Multi-scale Target Recognition Neural Network Based on Horizontal Expansion

  • CAO Zhaorui , 1 ,
  • ZHANG Wei 2 ,
  • HU Xiaoyang 1 ,
  • HAO Yongping 1 ,
  • LI Jinfeng 2 ,
  • LI Ziyang 2
Expand
  • 1 School of Equipment Engineering,Shenyang Ligong University,Shenyang 110159,Liaoning,China
  • 2 School of Mechanical Engineering,Shenyang Ligong University,Shenyang 110159,Liaoning,China

Received date: 2024-06-11

  Online published: 2025-09-22

Abstract

In response to the problem of suppressing image features of small-scale targets by large-scale targets in complex battlefield environments, a multi-scale target recognition convolutional neural network employing a lateral expansion strategy is designed. It works by constructing a three-channel lateral expansion feature extraction network and obstructing the extraction pathways for large, medium, and small targets' information within the convolutional module, linking up a multi-scale feature progressive fusion network to enhance the transmission and inheritance capabilities of high-and low-frequency semantic information of multi-scale targets within their respective pathways, and then predictively calculating the fused feature map with a multi-scale information reasoning modules to realize precise recognition of targets of different sizes and types. Results indicate that the designed algorithm achieves an accuracy of 92.2% and a recall rate of 80.6%, thereby enabling intelligent unmanned weaponry such as UAVs and smart loitering munitions to accurately and efficiently recognize multi-scale and multi-type targets.

Cite this article

CAO Zhaorui , ZHANG Wei , HU Xiaoyang , HAO Yongping , LI Jinfeng , LI Ziyang . Research on Multi-scale Target Recognition Neural Network Based on Horizontal Expansion[J]. Journal of Projectiles, Rockets, Missiles and Guidance, 2025 , 45(4) : 539 -546 . DOI: 10.15892/j.cnki.djzdxb.2025.04.012

0 引言

受人工智能技术发展和战争模式无人化趋势的推动,无人机、灵巧巡飞弹、无人潜航器等新型智能无人武器装备已成为现代小规模作战中的制胜要素[1-2]。在近期发生的俄乌冲突和巴以冲突中,诸如哈立德、Orlan-10、Leleka-100等具备察打一体能力的无人机被大量投入实战[3],并以极小的人员伤亡代价换取了显著战果。智能无人武器的作战效能必将在未来成为左右战局的关键因素。
机器视觉探测技术作为智能无人武器感知外界环境信息并完成后续作战任务的手段,直接影响了武器系统的技战术指标,因此受到了国内外研究人员的广泛重视[4]。王林等[5]设计了一种结合GSConv和VOVGSCSP的轻量级目标识别网络,降低了传统算法的计算开销;陆渊章等[6]提出了一种结合模板匹配和形态滤波的自主检测和协同跟踪算法,提高了无人机协同跟踪中的实时视觉跟踪性能;何明等[7]提出一种MBCF-YOLO算法,通过引入深度可分离卷积、循环注意力机制和优化的损失函数,显著提升了边缘设备上空对地目标检测的效率和精度,尤其在小微目标检测上表现突出。Sun等[8]提出一种基于YOLOv5s扩展至图像序列和帧间光流的无人机检测方法,通过整合时空信息和运动信息,显著提高了无人机检测的准确性和鲁棒性。Jiang等[9]提出了一种通过多尺度特征融合和多纤维网络优化的3D卷积神经网络,有效提升了战场目标聚集行为的识别精度和效率。
尽管上述方法能够配合民用无人机完成目标识别计算,但在实战环境下的应用与军用无人机的兼容方面存在不足。现代战场环境中,无人机需要重点识别的目标主要包括敌我单兵人员、装甲车辆、建筑物等[10-11]。这些目标尺寸不同、特征各异,且极易混合出现。为了应对复杂的目标环境,将目标划分为小、中、大三种类型。小目标指的是宽度或高度小于10像素,或者面积小于图像总面积的1%;中目标则定义为宽度或高度介于10~50像素之间,且面积占图像总面积的1%~5%;大目标则为宽度或高度大于50像素,或者面积超过图像总面积的5%。在这种情况下,体积较大且语义特征强烈的大目标会对尺寸较小、特征不明显的小目标产生抑制作用,导致常规卷积神经网络在检测小尺度目标时性能下降。
针对上述问题,文中提出了一种采用横向深化策略的多尺度目标识别卷积神经网络。该网络通过三通道横向拓展特征提取网络隔离不同尺度目标信息,结合多尺度特征融合网络强化高、低频语义信息传递,最终利用多尺度信息推理器实现精确的目标识别。

1 算法总体

图1为横向深化策略的多尺度目标识别卷积神经网络(horizontal deepening strategy for multi-scale object recognition convolutional neural network,HDMR)框架。视频流逐帧输入三通道横向拓展特征提取网络(three-channel horizontal expansion feature extraction network,THEFE)进行特征提取,通过类似于金字塔结构的多尺度特征渐进融合网络(multi-scale feature progressive fusion network,MPCF),将不同尺度的特征图F1,F2,F3进行融合后生成对应的F'1,F'2,F'3并输入到多尺度信息推理器(multi-scale information inference engine,MSIIE),该算法旨在提高多尺度目标的识别精度,特别是增强对小尺度目标的检测能力。
图1 算法框架图

Fig.1 Algorithm framework diagram

横向深化策略的多尺度目标识别卷积神经网络能有效整合不同尺度的特征信息,解决无人机在复杂战场环境下检测时体积较大且语义特征强烈的大目标会对尺寸较小、特征不明显的小目标产生抑制作用的问题,提升对小尺寸目标的检测能力,同时采用MPCF增强了检测精度。由此使无人机能够在复杂战场环境下更准确地识别多种目标,提高战场感知和作战效率。
算法流程如图2所示,系统从视频流中逐帧载入图像,确保后续处理的连续性。在特征提取阶段,通过多尺度语义特征融合策略提取视频帧中的语义信息,捕捉图像中的不同层次特征。在特征增强阶段,通过卷积操作和多尺度池化策略增强特征,提升对不同尺寸目标的检测能力。在特征融合阶段,采用多层次渐进式通道动态聚合模型,提升对微小目标的检测精度。在推理阶段整合特征,进行目标分类和位置预测,提高检测的准确性和稳定性。在目标判断阶段,判断是否存在目标,若无目标则继续处理下一帧,若有目标则输出类别和位置信息并继续检测。最后系统在处理完视频流或检测任务后自动终止。
图2 算法流程图

Fig.2 Algorithm flowchart

2 三通道横向拓展特征提取网络

图3为THEFE网络的结构图,该网络由卷积层(Conv)、通道空间特征融合模块(channel spatial feature fusion module,CSFM)和空间金字塔[12]池化快速模块(SPPF)组成。卷积层用于初步提取图像的低级特征。CSFM模块通过融合通道和空间特征,进一步提升特征表达能力。SPPF模块利用多尺度信息进行特征聚合,生成小尺度、高维度的特征图组。这些特征图组包含丰富的语义信息,有助于准确识别图像中的目标。
图3 THEFE网络结构图

Fig.3 THEFE network structure diagram

图4为Conv、SPPF模块结构图,其中图4(a)的Conv模块是一个基础的特征提取组件,整合了Conv2d用于捕获图像的局部特征;BN层用于加速训练并提高模型的稳定性;SiLU激活函数用于引入非线性,使得模型能够学习复杂的模式和数据表示。图4(b)的SPPF模块专注于通过MaxPool操作来提升计算效率。MaxPool通过选择池化窗口中的最大值来降低特征图的分辨率,这不仅减少了后续层的计算量,还有助于模型对空间变换的鲁棒性。SPPF模块还包含多个不同尺度的MaxPool操作[13],以捕获图像中不同尺度的特征,加速处理复杂结构的数据。
图4 Conv、SPPF模块结构图

Fig.4 Structure diagram of the Conv and SPPF modules

图5为CSFM模块的网络结构,主要用于处理上层神经网络传递下来的特征图。CSFM模块将输入特征图分为自下而上3条独立路径:第1条路径包含1个卷积层,用于提取基础或局部信息;第2条路径包含2个卷积层,用于捕捉中级特征;第3条路径包含3个卷积层,用于提取高级或全局特征。通过这种多路径、多尺度的处理方式,CSFM模块能够综合不同层次上的信息,生成更丰富、更全面的特征表示。
图5 CSFM模块

Fig.5 CSFM module

具体来说,输入尺度为C×H×W的输入X将首先沿维度按照1∶2∶4的比例被切分为3个特征图X1,X2,X3。在任意一个CSFM模块的卷积核被拆分为6个子集合[14]:
K=[K1,K2,K3,K4,K5,K6]
位于图5最底部的输入分支X1将经过分支卷积操作Conv1,计算后的输出Y1:
Y1=Conv1(X1)=X1*K1
位于输入分支X2将经过分支卷积Conv2计算后输出X2-1:
X2-1=Conv2(X2)=X2*K2
随后X2-1经过Conv3计算后输出Y2:
Y2=Conv3(X2-1)=X2-1*K3
同理X3将经过分支卷积Conv4,Conv5,Conv6计算后输出Y3:
X3-1=Conv4(X3)=X3*K4
X3-2=Conv5(X3-1)=X3-1*K5
Y3=Conv6(X3-2)=X3-2*K6
最后将Y1,Y2与利用Concatenate进行叠加,则可得到CSFM模块的输出Y,且Y的尺度与输入X的尺度均为C×H×W[15]
综合上述推导过程与图5的网络结构可知,CSFM相当于利用了卷积的维度拆分的方式,在单个模块内实现了横向的深度拓展,使得单个模块具有已输入信息的不同维度上开展针对性特征提取能力,能够自动处理不同尺度、不同种类的目标,提高了网络在复杂战场环境下的适应性和检测精度。

3 多尺度特征渐进融合网络

图6为MPCF网络结构,该结构是HDMR网络的关键组成部分,其主要功能在于连接主干网络和检测头。通过使用特征金字塔网络和路径聚合网络结构[16],有效融合了不同层次的特征信息,从而提升了目标检测的准确性和鲁棒性。该设计使得网络能够更加有效地处理多尺度信息,从而提高检测性能。
图6 MPCF网络结构图

Fig.6 MPCF network structure diagram

在战场环境中,MPCF通过多尺度特征融合、增强上下文信息、优化特征表示以及改进梯度流动,提升了模型的检测性能和准确性,使无人机更胜任实际战场环境中的小目标检测任务。

4 多尺度信息推理器

图7为MSIIE框架,该框架接受MPCF网络的输出,经过一系列卷积操作后生成自上而下3个特征图[17]。大尺寸特征图负责检测小目标,利用高分辨率特征图捕捉细节信息,提高对小目标的检测精度。中等尺寸特征图主要用于预测中等目标,通过平衡分辨率和感受野,适应中等规模目标的检测需求。最小尺寸特征图用于预测大目标,采用低分辨率特征图捕捉大目标的整体特征,增强对大目标的检测能力。随后,通过损失函数调整,以微调网络参数,优化检测性能。这种多尺度特征图的设计使得网络能够兼顾不同大小目标的检测需求,提高了整体检测的准确性和鲁棒性。
图7 MSIIE框架

Fig.7 MSIIE framework

在战场环境检测任务中,尤其是小目标物体识别时,传统神经网络将IOU作为计算策略的损失函数难以有效监督网络进行特征学习,比如当目标框不相交时,CIOU[18]无法有效地反映它们之间的距离信息,导致无法准确捕捉巡飞弹目标的空间分布,因此,基于横向深化的多尺度目标识别网络使用归一化Wasserstein 距离[19]作为损失函数。
在无人机目标检测中,由于真实物体形状与矩形框的差异,小目标框内常含背景像素。为优化检测,可将目标框建模为二维高斯分布,根据像素与中心的距离加权,强化中心区域前景像素的权重,从而提高无人机小目标检测的准确性。对于中心坐标及宽、高为xc,yc,w,h的水平框,用内接椭圆可表示为:
( x - μ x ) 2 σ x 2+ ( y - μ y ) 2 σ y 2=1
其中σx,σy是椭圆的中心点。对应到目标框中,即为μx=xc,μy=yc,σx=w/2,σy=h/2。则该椭圆二维高斯分布的概率可表示为:
f(L μ , σ)= e x p - 1 2 ( L - μ ) T σ - 1 ( L - μ ) 2 π σ 1 2
其中L,μ,σ分别表示中心坐标、均值和方差。此时则有:
( L - μ ) T σ - 1 ( L - μ ) = 1
该椭圆为二维高斯分布的一个分布轮廓。因此水平框建模满足二维高斯分布N(μ,σ),且分布为:
μ = x c y c σ = w 2 4 0 0 h 2 4
由此就将两个目标框之间的相似度通过二者间的高斯分布距离进行表示。随后,使用最优传输理论中的Wasserstein距离来计算两个分布的距离。对于两个二维高斯分布N1(m1,σ1),N2(m2,σ2),其2阶Wasserstein距离的定义为:
$W_{2}^{2}\left(\boldsymbol{\mu}_{1}, \boldsymbol{\mu}_{2}\right)=\left\|\boldsymbol{m}_{1}-\boldsymbol{m}_{2}\right\|_{2}^{2}+\left\|\boldsymbol{\sigma}_{1}^{1 / 2}+\boldsymbol{\sigma}_{2}^{1 / 2}\right\|_{F}^{2}$
其中$\|\cdot\|$是Frobenius范数。根据边界框A=(xca,yca,wa,ha)和B=(xca,yca,wb,hb)构建分布NaNb,则式(12)可进一步简化为:
$W_{2}^{2}\left(N_{\mathrm{a}}, N_{\mathrm{b}}\right)=\left\|\left(\left[x_{\mathrm{ca}}, y_{\mathrm{ca}}, \frac{w_{\mathrm{a}}}{2}, \frac{h_{\mathrm{a}}}{2}\right]^{\mathrm{T}},\left[x_{\mathrm{cb}}, x_{\mathrm{cb}}, \frac{w_{\mathrm{b}}}{2}, \frac{h_{\mathrm{b}}}{2}\right]^{\mathrm{T}}\right)\right\|_{2}^{2}$
然而 W 2 2(Na,Nb)是距离度量,并且不能直接用作相似性度量。使用其指数形式归一化,并获得归一化Wasserstein距离DNWD的新度量,其公式为:
DNWD(Na,Nb)=exp - W 2 2 ( N a , N b ) C
其中C是与数据集密切相关的常数。DNWD 在检测微小物体方面具有尺度不变性、位置偏差的平滑度与测量不重叠或相互包含的边界框之间相似性的能力,更适合无人机下战场环境下的检测任务。

5 实验结果

5.1 硬件环境与数据集的构建

数据集使用12 000张车辆、人员等常见目标图像并经过一系列的预处理。首先,确保每张图像都进行了准确的目标标注,标注内容包括目标的位置信息和目标的类别标签。接着,为确保输入图像的一致性,需要将图像尺寸统一,使其适应模型的输入要求。此外,为增强数据的多样性和提高模型的鲁棒性,采用数据增强技术(如图像的旋转、翻转、缩放等操作),从而模拟不同的拍摄角度和环境变化。然后对HDMR进行训练与测试,数据集按照8∶1∶1的比例进行训练、验证和测试集的划分。为验证HDMR在不同微型终端下的计算效力,将基于如图8所示的Jetson Orin NX、RK3588与Altas200DK进行识别推理测试。
图8 硬件环境

Fig.8 Hardware environments

配备AMD Ryzen 9 7945HX CPU和RTX4060 8G GPU的计算机完成HDMR网络的训练后,将生成权重嵌于微型终端中进行测试,3种微型终端的性能参数与算法测试性能效果如表1所示。
表1 微型终端性能参数

Table 1 Microcontroller performance parameters

Parameter Jetson Orin NX RK3588 Altas200DK
CPU 6-core Cortex-A78AE v8.2 4×Cortex-A76+4×Cortex-A55 (64-bit) 4core×1.0 GHz
GPU 1024-core NVIDIA Ampere GPU ARM Mali-G610 MC4 Ascend 310 AI Processor
Computing power 70 tera operations per second 6 tera operations per second 8 tera operations per second
Size/mm 63×30×34 160×109×12 139×136×46
Mass/g 70 10 30
Frame rate/FPS 24 16 17
根据表1性能参数,选用Jetson Orin NX做为硬件环境,软件采用PyTorch 1.12.0,CUDA 10.2以及SGD优化算法[20]
为了研究模型的性能,采用的参数保持一致。其中,batch_size定义了每次迭代处理的图像数量,较大的batch_size虽然能提高训练速度,但也会消耗更多内存资源。文中选择16作为batch_size的初始值,以平衡训练速度和内存使用。learning_rate控制了模型在每次迭代时权重更新的幅度,合理的学习率能够确保训练过程的稳定性与效率。文中选择0.001作为初始学习率,避免了训练过程中的不稳定性,并提高了收敛速度。epochs代表了模型训练的总轮数,文中设置为300,确保模型能够充分学习数据中的特征。

5.2 实验结果

采用精度P、召回率R和平均精度均值VmAP作为主要评价指标来衡量检测算法的性能[21]
将Faster R-CNN、YOLOv5、YOLOv7算法和文中提出的HDMR算法进行对比,以评估改进后的算法在目标检测任务中的有效性。具体实验结果如表2所示。
表2 实验对比结果

Table 2 Experimental comparison results

Algorithm P R VmAP
Faster R-CNN 0.845 0.741 0.831
YOLOv5 0.895 0.772 0.875
YOLOv7 0.903 0.775 0.879
HDMR 0.922 0.806 0.892
实验结果表明,文中算法相对于Faster R-CNN,P提升了9.1%,R提升了8.7%,VmAP提升了7.3%;相对于YOLOv5,P提升了3%,R提升了4.4%,VmAP提升了1.9%;相对于YOLOv7,P提升了2.1%,R提升了4%,VmAP提升了1.5%,这意味着在所有被预测为正类的样本中,文中算法正确预测的比例更高,表明文中HDMR算法在减少误报方面有显著改进,并且在所有实际为正类的样本中能够正确识别出更多的正类样本,显著提高了模型的检测能力。VmAP指标也有提升,这一指标综合了精度和召回率的表现,体现了文中模型在不同阈值下的整体性能提升。
为验证提出的通道空间特征融合模块的效果,进行了消融实验。实验分别在基干网络的第2层,第2、4层,第2、4、6层和第2、4、6、8层引入通道空间特征融合模块,分别记为CSFM_2、CSFM_24、CSFM_246和CSFM_2468,得出结果如表3所示。
表3 消融实验

Table 3 Ablation experiment

Algorithm P R VmAP
CSFM_2 0.799 0.8 0.85
CSFM_24 0.904 0.793 0.89
CSFM_246 0.875 0.781 0.887
CSFM_2468 0.922 0.806 0.892
实验结果显示,文中所采用的方法在PRVmAP等指标上均优于其他方案,验证了该方法在目标识别任务中的有效性和优越性。

5.3 效果展示

单一目标检测效果对比图如图9所示。图9(a)、(c)、(e)为YOLOv5算法检测效果图,图9(b)、(d)、(f)为文中算法检测效果图。效果对比中,文中提出的算法与YOLOv5在单一车辆检测任务中展示了显著的性能差异。尤其是在车辆距离拍摄点较远的情况下,由于透视效应和图像分辨率的限制,车辆在图像中呈现为小目标,其视觉特征相对模糊,导致传统目标检测算法如YOLOv5难以实现准确识别。相较之下,文中算法在这些挑战条件下仍能成功检测到目标车辆,突显了其在小目标检测方面的敏感性和优越性能。这一优势主要体现在算法能够更好地捕捉和利用小目标的细微特征,从而提高了检测的准确性和鲁棒性。
图9 单一目标检测效果对比图

Fig.9 Comparative analysis of single target detection performance

图10显示了在检测目标数量较多,尤其是小目标较多的情况下,不同算法的检测效果对比。图10(a)、(c)、(e)为YOLOv5检测效果,图10(b)、(d)、(f)为文中算法检测效果,YOLOv5算法在这种复杂场景中的表现并不理想。由于车辆数量繁多,YOLOv5有时无法准确检测到大部分车辆,导致许多车辆未被识别或检测结果出现混乱。这主要是因为YOLOv5在处理高密度目标和小目标时,难以有效地提取和识别这些目标的细微特征。相比之下,文中提出的算法在复杂场景中表现出色,检测效果稳定。即使在小目标较多的情况下,文中算法依然能够更为全面准确地检测到目标车辆。此外,文中算法在处理复杂背景和多目标干扰时也表现出色。能够有效地区分目标与背景噪声,从而提高检测的可靠性。
图10 复杂场景下不同算法检测效果图

Fig.10 Detection performance comparison in complex scenarios using different algorithms

6 结论

设计了一种采用横向深化策略的多尺度目标识别卷积神经网络,以解决复杂战场环境下大尺度目标对小尺度目标图像特征抑制的问题。通过构建三通道横向拓展特征提取网络和多尺度特征渐进融合网络,成功阻隔了大、中、小目标的信息提取链路,并增强了多尺度目标高、低频语义信息的传递与继承能力。实验结果表明,在文中约束条件下,该算法实现了92.2%的准确率和80.6%的召回率,若将其工程化后,能够提升无人机、灵巧巡飞弹等智能无人武器装备对多尺度、多种类目标的精确识别能力。
[1]
陈静, 宫黎明. 机器视觉在军事领域的应用现状及发展趋势[J]. 遥测遥控, 2022, 43(6): 124-135.

CHEN J, GONG L M. Application status and development trend of machine vision in military field[J]. Journal of Telemetry, Tracking and Command, 2022, 43(6): 124-135.

[2]
王笑梦. 无人机的天空从俄乌战争看无人机的应用和发展[J]. 坦克装甲车辆, 2022(15): 60-66.

WANG X M. The sky of drones: observing the application and development of drones from Russia-Ukraine War[J]. Tank & Armoured Vehicle, 2022(15): 60-66.

[3]
马攀伟, 潘奎, 潘竟峰, 等. 从俄乌冲突看自杀式无人机的作战运用与发展[J]. 舰船电子对抗, 2024, 47(2): 1-3.

MA P W, PAN K, PAN J F, et al. Combat operation and development of suicide drone from the Russian-Ukrainian Conflict[J]. Shipboard Electronic Countermeasure, 2024, 47(2): 1-3.

[4]
王磊. 智能无人指挥控制系统特点及研究方法的思考[J]. 弹箭与制导学报, 2022, 42(1): 77-81.

DOI

WANG L. Reflection on characteristics and research methods of intelligent unmanned command and control system[J]. Journal of Projectiles, Rockets, Missiles and Guidance, 2022, 42(1): 77-81.

[5]
王林, 赵莉, 王无为. 高动态场景下无人机空对空目标检测方法研究[J]. 计算机工程, 2024, 50(12): 265-275.

DOI

WANG L, ZHAO L, WANG W W. Air-to-air target detection of unmanned aerial vehicles under high dynamic scenarios[J]. Computer Engineering, 2024, 50(12): 265-275.

DOI

[6]
陆渊章, 戴红霞, 胡莹, 等. 基于机器视觉的无人机协同目标跟踪算法研究[J]. 电子器件, 2020, 43(5): 1096-1099.

LU Y Z, DAI H X, HU Y, et al. Research on cooperative target tracking algorithm for UAV based on machine vision[J]. Chinese Journal of Electron Devices, 2020, 43(5): 1096-1099.

[7]
何明, 朱梓涵, 翟绪龙, 等. 基于多分支上下文融合的空对地目标检测算法[J]. 现代防御技术, 2023, 51(3): 91-98.

DOI

HE M, ZHU Z H, ZHAI X L, et al. Air-to-ground target detection algorithm based on multi-branch context fusion[J]. Modern Defense Technology, 2023, 51(3): 91-98.

DOI

[8]
SUN Y, ZHI X Y, HAN H W, et al. Enhancing UAV detection in surveillance camera videos through spatiotemporal information and optical flow[J]. Sensors, 2023, 23(13): 6037.

[9]
JIANG H Y, PAN Y Z, ZHANG J, et al. Battlefield target aggregation behavior recognition model based on multi-scale feature fusion[J]. Symmetry, 2019, 11(6): 761.

[10]
杜玉龙, 李建增, 张岩, 等. 无人机战场侦察中目标识别算法研究综述[J]. 飞航导弹, 2016(7): 38-41.

DU Y L, LI J Z, ZHANG Y, et al. A review of target recognition algorithms in battlefield reconnaissance by drones[J]. Aerodynamic Missile Journal, 2016(7): 38-41.

[11]
张河山, 范梦伟, 谭鑫, 等. 基于改进YOLOX的无人机航拍图像密集小目标车辆检测[J]. 吉林大学学报(工学版), 2025, 55(4): 1307-1318.

ZHANG H S, FAN M W, TAN X, et al. Dense small object vehicle detection in UAV aerial images using improved YOLOX[J]. Journal of Jilin University (Engineering and Technology Edition), 2025, 55(4): 1307-1318.

[12]
李惠惠, 范军芳, 陈启丽. 改进YOLOv5的遥感图像目标检测[J]. 弹箭与制导学报, 2022, 42(4): 17-23.

DOI

LI H H, FAN J F, CHEN Q L. Improved YOLOv5 remote sensing image target detection[J]. Journal of Projectiles, Rockets, Missiles and Guidance, 2022, 42(4): 17-23.

[13]
史涛, 崔杰, 李松. 优化改进YOLOv8实现实时无人机车辆检测的算法[J]. 计算机工程与应用, 2024, 60(9): 79-89.

DOI

SHI T, CUI J, LI S. Algorithm for real-time vehicle detection from UAVs based on optimizing and improving YOLOv8[J]. Computer Engineering and Applications, 2024, 60(9): 79-89.

DOI

[14]
MAJIB M S, RAHMAN M M, SAZZAD T M S, et al. VGG-SCNet: A VGG net-based deep learning framework for brain tumor detection on MRI images[J]. IEEE Access, 2021, 9: 116942-116952.

[15]
DING S, HUANG H, LI Z M, et al. SCNET: A novel UGI cancer screening framework based on semantic-level multimodal data fusion[J]. IEEE Journal of Biomedical and Health Informatics, 2021, 25(1): 143-151.

[16]
杨兴志. 改进YOLOv5s算法的无人机小目标检测方法[J]. 科学技术创新, 2024(11): 80-83.

YANG X Z. Improved YOLOv5s algorithm for small target detection in unmanned aerial vehicles[J]. Science and Technological Innovation, 2024(11): 80-83.

[17]
王一桥, 杨波, 江承雨, 等. 基于改进YOLOv5的无人机视觉目标检测[J]. 电光与控制, 2024, 31(8): 98-103.

WANG Y Q, YANG B, JIANG C Y, et al. UAV vision target detection based on improved YOLOv5[J]. Electronics Optics & Control, 2024, 31(8): 98-103.

[18]
董恒祥, 潘江如, 董芙楠, 等. 基于YOLOv5s模型的边界框回归损失函数研究[J]. 现代电子技术, 2024, 47(3): 179-186.

DONG H X, PAN J R, DONG F N, et al. Research on bounding box regression loss function based on YOLOv5s model[J]. Modern Electronics Technique, 2024, 47(3): 179-186.

[19]
张珂, 马宇晴, 朱礼龙, 等. 基于改进YOLOv7的安全帽检测算法[J]. 合肥学院学报(综合版), 2024, 41(2): 91-99.

ZHANG K, MA Y Q, ZHU L L, et al. Algorithm of safety helmet detection based on improved YOLOv7[J]. Journal of Hefei University (Comprehensive Edition), 2024, 41(2): 91-99.

[20]
阮乐笑. 用于训练神经网络的自适应梯度下降优化算法[J]. 哈尔滨商业大学学报(自然科学版), 2024, 40(1): 25-31.

RUAN L X. Adaptive gradient descent optimization algorithm for training neural networks[J]. Journal of Harbin University of Commerce (Natural Sciences Edition), 2024, 40(1): 25-31.

[21]
魏仁干, 丰霜, 孔华锋. 基于全维动态卷积的无人机航拍图像轻量化目标检测[J]. 计算机应用与软件, 2024, 41(5): 158-165.

WEI R G, FENG S, KONG H F. Lightweight target detection for UAV aerial image based on omni-dimensional dynamic convolution[J]. Computer Applications and Software, 2024, 41(5): 158-165.

Outlines

/