利索能及
我要发布
收藏
专利号: 2025102948897
申请人: 南京信息工程大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-12
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于改进YOLOv8的人脸目标检测方法,其特征在于,包含以下步骤:步骤1,使用人脸数据集,如果所述人脸数据集已提供训练集与验证集,则直接挑选出训练集与验证集待用,否则按比例划分出训练集与验证集,将训练集和验证集的全部标签转换为YOLO格式,并全部归于face类别,即人脸类别;

步骤2,构建并训练改进后的YOLOv8网络模型,所述改进后的YOLOv8网络模型包括骨干网络、颈部网络和头部网络;

将训练集图像经过预处理后输入骨干网络,得到三种不同尺寸的特征图;

通过注意力加权特征融合模块C2f_DA和基于注意力的尺度内特征交互模块AIFI对骨干网络进行重构,重构后的骨干网络包括卷积模块、特征融合模块、注意力加权特征融合模块和尺度内特征交互模块;

所述注意力加权特征融合模块先通过卷积初步处理输入数据,再分割数据送入两个以上融入可变形注意力机制DAttention的残差块,实现不同层次的注意力加权和特征融合,最后将残差块的输出进行拼接;

步骤3,将所述三种不同尺寸的特征图输入颈部网络,并基于特征金字塔网络FPN和路径聚合网络PAN,以自下而上和自顶向下两种方式进行特征融合,得到融合后的特征图;

步骤4,使用头部网络中的检测头对融合后的特征图进行预测,生成目标的类别和边界框的位置,并利用非极大抑制NMS去除重叠的预测框,得到最终检测结果;在训练过程中同步使用验证集进行验证,每轮训练结束后计算模型评价指标,并基于模型评价指标选择模型权重;

步骤4中,得到经过非极大抑制NMS筛选的预测框后,计算预测框和真实框之间的损失值,所述损失值包括目标分类损失和边界框回归损失;其中,设计了跨空间平移的角度约束交并比损失TAIoU,以优化边界框回归损失,TAIoU的公式为:,

所述TAIoU包括平移敏感的角度约束损失函数TSACLoss和交并比指标IoU;其中,所述平移敏感的角度约束损失函数TSACLoss的公式为: ,

其中,表示角度损失,表示预测框与真实框的宽度差异,和 分别表示真实框左上角的顶点和左下角的顶点, 和 分别表示预测框左上角的顶点和左下角的顶点, 是点和 点垂直距离差, 是 点和 点垂直距离差, 表示平移距离d后由 点到 点的向量, 表示平移距离d后由 点到 点的向量, 表示平移距离d后由 点到 点的向量, 是真实框的宽度,TSACLoss是角度约束损失值;K表示当前批次中预测框的数量。

2.根据权利要求1所述的方法,其特征在于,步骤1包括:针对人脸数据集,按YOLO的方式创建文件夹结构,把训练集和验证集中的图像数据和文本标签放入对应文件夹,编写脚本将人脸数据集转化为YOLO格式,统一目标对象的类别编号为face:0。

3.根据权利要求2所述的方法,其特征在于,步骤2包括:

步骤2.1,将训练集中图像大小统一调整,检查图像的通道顺序为红绿蓝RGB,采用Mosaic数据增强方法处理图像,再输入到骨干网络中;

步骤2.2,骨干网络中所述卷积模块有6个,分别为第一卷积模块、第二卷积模块、第三卷积模块、第四卷积模块、第五卷积模块和第六卷积模块,所述特征融合模块有3个,分别为第一特征融合模块、第二特征融合模块和第三特征融合模块;

其中,所述第一卷积模块、第二卷积模块和第一特征融合模块串行连接,形成基础特征提取链路,随后第三卷积模块和第二特征融合模块串行连接,经由第四卷积模块和第三特征融合模块重复堆叠,实现逐步下采样;第五卷积模块与注意力加权特征融合模块串行连接,输出由第六卷积模块压缩通道,并输入至尺度内特征交互模块,尺度内特征交互模块通过多头自注意力增强全局语义,最终与注意力加权特征融合模块的输出进行残差连接;其中,第二特征融合模块和第三特征融合模块通过跨层跳跃连接将浅层高分辨率特征直接传递至深层的颈部网络;

所述6个卷积模块用于基础特征提取与通道维度调整;

所述3个特征融合模块用于多尺度特征融合;

所述注意力加权特征融合模块采用可变形注意力机制DAttention的注意力头,输出公式为:,

其中, 表示第m个注意力头的输出,表示softmax函数, 表示查询第m个注意力头的嵌入, 表示变形后的键值,表示每个注意力头的维度, 表示采样函数,是采样网格坐标,是动态偏移量, 表示变形后的价值;

使用固定位置编码表显式地学习查询与键值之间的空间关系,固定位置编码表服从期2

望为0、方差为0.01的正态分布,且满足:

其中, 表示固定位置编码表,是三维张量, 是查询序列长度, 是键值序列长度;

在注意力加权特征融合模块后添加一层1×1的第六卷积模块,以适配尺度内特征交互模块;注意力加权特征融合模块输出的特征图尺寸为20×20×1024,经1×1的第六卷积模块压缩通道数至256,尺寸为20×20×256的特征图由尺度内特征交互模块展平,变为400×

256,通过二维正弦余弦位置编码增强空间信息,利用多头自注意力机制和前馈网络学习交互特征,最终将输出特征图尺寸恢复为20×20×1024;注意力加权特征融合模块与尺度内特征交互模块级联,实现局部形变感知到全局语义增强的双阶段特征提取;

步骤2.3,提取骨干网络第五、七、十一层的特征信息得到三种不同尺寸的特征图,尺寸大小分别80×80、40×40、20×20。

4.根据权利要求3所述的方法,其特征在于,步骤3包括:

步骤3.1,所述颈部网络包括特征融合模块和卷积模块;

所述颈部网络的特征融合模块有4个,分别为第四特征融合模块、第五特征融合模块、第六特征融合模块和第七特征融合模块;所述颈部网络的卷积模块有2个,分别为第七卷积模块、第八卷积模块;

所述第四特征融合模块、第五特征融合模块用于特征金字塔网络FPN,从20×20的特征图开始,经过上采样与第三特征融合模块跨层连接,结果输出至第四特征融合模块,第四特征融合模块经过上采样后与第二特征融合模块跨层连接,结果输出至第五特征融合模块,完成自底向上的特征融合,增强语义信息;

所述第六特征融合模块、第七特征融合模块用于路径聚合网络PAN,从80×80的特征图开始,通过第七卷积模块实现下采样,与第四特征融合模块跨层连接,结果输出至第六特征融合模块,第六特征融合模块通过第八卷积模块实现下采样,与尺度内特征交互模块跨层连接,结果输出至第七特征融合模块,完成自顶向下的特征融合,细化定位;

2个卷积模块用于特征维度对齐;

步骤3.2,在4个特征融合模块的融合过程中,不同分辨率的特征图经过两次以上的卷积、上采样、下采样和逐元素相加,最终形成了80×80、40×40、20×20三种尺寸的优化特征图,输出优化特征图。

5.根据权利要求4所述的方法,其特征在于,步骤4包括:

步骤4.1,所述头部网络包括卷积模块和卷积层;

所述头部网络的卷积模块有6个,所述卷积层有6个,6个卷积模块与6个卷积层一一对应,串行连接;

所述卷积模块和卷积层用于生成边界框预测和分类预测;

步骤4.2,过滤掉预测特征图中置信度小于阈值的预测框;再使用非极大抑制NMS去除冗余的预测框,保留最有可能包含目标物体的预测框,NMS的公式为:,

其中, 代表第i个预测框的得分, 表示预测框 与第i个预测框 之间的交并比, 是分数最高的预测框,表示第i个预测框, 表示阈值;i取值为1 K。

~

6.一种电子设备,其特征在于,包括处理器和存储器,所述存储器存储有程序代码,当所述程序代码被所述处理器执行时,使得所述处理器执行如权利要求1至5中任一项所述的方法的步骤。

7.一种存储介质,其特征在于,存储有计算机程序或指令,当所述计算机程序或指令在计算机上运行时,执行如权利要求1至5中任一项所述的方法的步骤。