利索能及
我要发布
收藏
专利号: 2026101064732
申请人: 东北电力大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于改进YOLOv8s的水下垃圾识别方法,其特征在于,具体包括以下步骤:步骤1:获取水下垃圾图像,形成第一数据集;所述第一数据集中的图像可通过网络进行收集获取或水下机器人进行拍摄获取;

步骤2:为所述第一数据集中的图像添加标注信息,形成第二数据集,并将所述第二数据集按预设的比例划分为训练集、验证集和测试集;

步骤3:构建基于改进YOLOv8s的水下垃圾识别模型,所述模型包括改进的主干网络,改进的颈部网络和改进的头部网络,所述模型的构建进一步包括步骤3.1至步骤3.3:步骤3.1:所述改进的主干网络由依次连接的Conv-1、Conv-2、C2f-1、Conv-3、C2f-2、Conv-4、C2f-Faster-EMA-1、Conv-5、C2f-Faster-EMA-2和SPPF模块组成;

将所述第二数据集中的训练集和验证集作为改进的主干网络的输入;

所述改进的主干网络通过C2f-1、C2f-2、C2f-Faster-EMA-1、C2f-Faster-EMA-2和SPPF模块分别输出5种不同尺度的特征信息;

步骤3.2:所述改进的颈部网络,由BRSAM、TFE-1C2f-3、TFE-2C2f-4、MS-DSFLAM、CPAM-

1、Upsample、CPAM-2、Concat-1和Concat-2模块组成;

所述C2f-1和C2f-2的输出作为所述TFE-2C2f-4的输入,C2f-1的输出同时也作为CPAM-

1的输入;

所述C2f-2、C2f-Faster-EMA-1和C2f-Faster-EMA-2的输出作为MS-DSFLAM的输入,所述MS-DSFLAM和TFE-2C2f-4的输出作为CPAM-2的输入;

所述MS-DSFLAM的输出同时也作为UpSample的输入,所述UpSample的输出作为CPAM-1的输入;

所述SPPF的输出作为BRSAM的输入,所述C2f-Faster-EMA-1和BRSAM的输出作为TFE-

1C2f-3的输入,所述CPAM-2和TFE-1C2f-3的输出作为Concat-1的输入,所述TFE-1C2f-3和Concat-1的输出作为Concat-2的输入;

步骤3.3:所述改进的头部网络包括Detect-1、Detect-2、Detect-3和Detect-4模块;将CPAM-1的输出作为Detect-1的输入;将CPAM-2的输出作为Detect-2的输入;将Concat-1的输出作为Detect-3的输入;将Concat-2的输出作为Detect-4的输入;

步骤4:采用训练集和验证集对所述基于改进YOLOv8s的水下垃圾识别模型进行训练,将训练好的模型保存为最优模型;所述基于改进YOLOv8s的水下垃圾识别模型训练过程,进一步包括步骤4.1至步骤4.4:步骤4.1:设置所述基于改进YOLOv8s的水下垃圾识别模型训练参数;

模型训练参数包括:迭代轮数、批次大小、优化器、学习率、动量、权重衰减和线程数;

步骤4.2:将所述训练集和验证集输入到所述基于改进YOLOv8s的水下垃圾识别模型中,使用反向传播算法计算损失函数对模型参数的梯度;

步骤4.3:使用优化器来更新模型参数,使其朝着梯度下降的方向更新;直到训练集和验证集的损失函数不再下降,同时准确率P、召回率R、mAP50和mAP50-95评价指标也不再提高;

步骤4.4:将训练好的模型参数保存为最优模型;

步骤5:采用所述测试集对所述最优模型进行测试,对测试集的测试结果进行客观评价指标评估,满足精度要求,获得最终的基于改进YOLOv8s的水下垃圾识别模型。

2.根据权利要求1所述的基于改进YOLOv8s的水下垃圾识别方法,其特征在于,所述步骤3.1中的2个C2f-Faster-EMA模块,结构相同,其构建方法进一步包括步骤3.1.1至3.1.3:步骤3.1.1:所述C2f-Faster-EMA模块,是将原YOLOv8s网络中的C2f模块中的BottleNeck模块替换为Faster-EMA模块;

步骤3.1.2:所述步骤3.1.1中的Faster-EMA模块,是将FasterNet网络中的FasterBlock模块加入EMA注意力机制,得到Faster-EMA模块;

步骤3.1.3:所述步骤3.1.2中的EMA注意力机制,基于多尺度并行处理架构,包含两条1×1卷积路径和一条3×3卷积路径;

在两条1×1卷积路径中,采用双路1D全局平均池化,分别沿x轴和y轴方向对通道信息进行编码;同时,在方向h上对两个特征编码进行连接操作;此外,为了在1×1分支的两个平行路线之间实现不同的跨通道交互特征,通过简单的乘法聚合了每个组内的两个通道注意力图;

在3×3卷积路径中,采用单层3×3卷积核堆叠结构,通过3×3卷积操作实现局部跨通道交互,3×3分支同样引入了全局平均池化层,并通过联合激活函数实现特征维度的自适应转换。

3.根据权利要求1所述的基于改进YOLOv8s的水下垃圾识别方法,其特征在于,所述步骤3.2中的BRSAM模块,是将CBAM注意力机制中的通道注意力机制替换为Bilevel-RoutingAttention注意力机制,保留空间注意力机制;

所述Bilevel-RoutingAttention注意力机制,其构建方法进一步包括步骤3.2.1至

3.2.5:

步骤3.2.1:给定一个2D输入特征图X,该特征图 ,H表示高度,W表示宽度,C表示通道数;将其划分为S×S个非重叠区域,每个区域包含 特征向量,这一步骤通过重构X来完成,即 ;根据所得查询、键、值的张量,Q,K, ,则线性投影如公式(1)至公式(3)所示:

(1),

(2),

(3),

q k

式(1)至式(3)中,Q,K,V分别表示查询、键和值;W 、W 和 分别表示为查询、键、值的投影权重;

步骤3.2.2:通过应用在各个区域的平均值,得出区域级查询和键 ,通过Q和转置K之间的矩阵乘法推到得到区域间亲和矩阵,计算公式如公式(4)所示:(4),

r

式(4)中,邻接矩阵A中的元素衡量了两个区域在语义上的相关程度;

r

步骤3.2.3:裁剪亲和图,得出一个路由索引矩阵I,计算公式如式(5)所示:(5),

r

式(5)中,k表示每个区域选择的最相关区域数量;A 表示邻接矩阵;TopK表示索引选择函数,计算出与当前区域最相关的k个区域;

步骤3.2.4:区域i中的每个查询令牌位于关注度停留在k个路由索引矩阵区中的所有键值对,同时以 为索引,获得键和值的张量,计算公式如式(6-7)所示:

(6),

(7),

式(6)至式(7)中, 是键和值的张量;

步骤3.2.5:对计算得到的键值对应用Bilevel-RoutingAttention注意力机制,计算公式如式(8)所示:(8),

式(8)中,O表示注意力输出特征,LCE(V)表示局部上下文增强方法;

所述空间注意力机制,其构建方法进一步包括步骤3.2.6至3.2.7:步骤3.2.6:使用全局最大池化和全局平均池化操作,对Bilevel-RoutingAttention注意力模块得到的特征 进行处理,生成两个描述每个空间位置重要性的权重矩阵;

步骤3.2.7:对这两个权重矩阵进行通道拼接操作,通过一个7×7的卷积操作将2个通道降维为1个通道,经过SigMod激活函数操作得到 ; 的计算公式如式(9)所示:(9),

7×7

式(9)中,f 为卷积操作,AvgPool为全局平均池化操作,MaxPool为全局最大池化操作,σ为SigMod激活函数, 为平均池化特征, 为最大池化特征。

4.根据权利要求1所述的基于改进YOLOv8s的水下垃圾识别方法,其特征在于,所述步骤3.2中的改进的颈部网络中,MS-DSFLAM模块的构建方式是在ASF-Yolo颈部网络中的SSFF模块中增加DySample动态采样模块;

所述MS-DSFLAM模块,包括三个输入分别是P3、P4-1和P5,2个Conv1d、2个DySample、Concat、Conv3d、BN、LeakyReLU和MaxPool3d模块和一个输出P4-2;

所述DySample动态采样模块,通过学习采样位置并对规则采样点进行动态调整,将特征上采样过程转化为基于采样点的重采样过程;具体地,模块以低分辨率特征图为输入,利用轻量级偏移预测网络生成采样偏移量,并将其与预定义的规则采样网格相结合,得到动态采样点位置;随后通过双线性重采样方式在连续特征空间中重建高分辨率特征,从而在显著降低计算复杂度的同时,实现对目标边缘和结构信息的自适应建模。

5.根据权利要求1所述的一种基于改进YOLOv8s的水下垃圾识别方法,其特征在于,所述步骤5,进一步包括步骤5.1至步骤5.3:步骤5.1:将所述测试集输入到步骤4保存的最优模型中;

步骤5.2:计算模型性能指标:准确率P、召回率R、mAP50和mAP50-95,具体计算公式如下所示:(10),

(11),

(12),

(13),

式(10)至式(13)中,P为准确率,R为召回率,mAP为所有类别的平均准确率均值,AP为平均精度,m为水下垃圾标签总类别数,TP表示正样本被正确识别为正样本的个数,FP表示负样本被错误识别为正样本的个数,FN表示正样本被错误识别为负样本的个数;

mAP50表示IoU阈值固定为0.5时的平均精度,mAP50-95表示IoU阈值从0.5到0.95之间,每隔0.05计算一次平均精度,然后取这些平均精度的平均值;

步骤5.3:对测试集的测试结果进行客观评价指标评估,满足精度要求,即获得最终的基于改进YOLOv8s的水下垃圾识别模型。