利索能及
我要发布
收藏
专利号: 202410431316X
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种无人机场景下基于多模态的开放词集目标检测方法,其特征在于,该方法包括如下步骤:S1、在训练阶段,初始化基于Transformer结构模型的参数,使用标注了不同类别物体的无人机航拍图像集作为训练集训练该目标检测模型,得到开放词集目标检测模型OV‑DETR;

S2、将待检测图像输入OV‑DETR模型编码器中卷积计算后获得特征图 F,再将特征图输入RPN网络,选取对象性分数高于设定阈值的锚框作为可能包含目标物体的位置先验框Q;

S3、将位置先验框Q与带有位置编码的特征图 一同输入OV‑DETR模型解码器中进行自注意力计算,得到目标对象的预测框和类别预测以及对应的分类置信度,置信度高于设定阈值的对象输出预测框定位和预测类别,否则,采用CLIP多模态模型进行二次类别预测;

S4、设计类别标签集,得到关联拍摄场景的语言提示,与图像分别编码后输入CLIP模型,计算余弦相似度后,相似度最高的类别即为分类结果。

2.根据权利要求1所述的一种无人机场景下基于多模态的开放词集目标检测方法,其特征在于,所述S1的具体方法如下:(1)训练任务采用Visdrone2019标准数据集,该数据集每张图片均有类别标注和拍摄环境数据,数据集表示为 ,其中,表示第i张图像, 表示对应图像的标注信息,包括目标类别和边界框信息, 表示对应图像拍摄环境信息,包括高度和视角信息,N为数据集大小,标注信息 ,其中, 表示第i张图片第j个目标的类别, 表示对应的边界框, 是第i张图像中目标的数量;

(2)对数据集图像进行标准化、缩放的预处理操作,初始化编码器参数 和解码器参数 ,定义位置损失函数 和类别损失函数 ,位置损失采用用于回归任务的损失函数,类别损失使用交叉熵损失函数, ,其中, 表示平滑的损失函数, 是模型预测得到的第j个目标的边界框, 是第j个目标的真实边界框, ,其中, 表示交叉熵损失函数,是模型预测的第j个目标的类别, 是第j个目标的真实类别;

(3)计算总损失 ,反向传播更新模型参数,包括编码器参数 和解码器参数 ;

(4)循环重复第(3)步,直至达到收敛条件。

3.根据权利要求2所述的一种无人机场景下基于多模态的开放词集目标检测方法,其特征在于,所述S2中具体为:对于给定的待检测图片I,尺寸为 ,W和H是图片的宽度和高度,通道数为C,首先送入OV‑DETR模型编码器中的主干卷积神经网络ResNet50得到特征图F,尺寸为 ,和 是特征图的宽度和高度, 是特征图的通道数,再将特征图送入区域提议网络RPN,在特征图的每个像素位置上生成k个不同尺寸和宽高比的锚框,锚框总数为 ,对于每个锚框,RPN同时预测目标存在的概率 和边界框修正值预测 ,过程表示为,其中, 和 均是通过卷积层计算预测概率和修正值,最终生成一组修正后的候选框 以及相应的对象性分数 ,计算过程为,其中, 表示第i个锚框, 是一个函数,用于将初始锚框 根据修正值 进行调整,选取对象性分数 大于设定阈值的锚框标注为待识别目标,作为位置先验信息Q。

4.根据权利要求3所述的一种无人机场景下基于多模态的开放词集目标检测方法,其特征在于,所述S3的方法如下:(1)对于S2中获取的特征图F添加位置编码PE,通过正弦和余弦函数表示:;

其中,pos表示特征图中每个位置的索引,m是位置编码的维度索引, 是模型隐藏表示大小,将位置编码与特征图相加,得到编码后的特征表示: ,加入S2中获取的先验位置信息,其表示为一个大小为M*4的张量Q,其中,M是先验位置框数量,每个位置有四个值表示边界框的位置,编码器输出为 ,其中, 代表将带有位置编码的特征图 与先验位置信息Q进行连接操作;

将编码后的特征输入解码器的多层Transformer结构中,使用自注意力操作学习特征图中不同位置之间的关系,获得拥有全局感受野的高维特征向量z,再输入到前馈神经网络中进行非线性变换,得到特征表示 ,计算过程表示为:;

其中, 和 是权重矩阵、 和 是偏置向量, 是修正线性单元函数,在解码器的最后一层,通过全连接层计算得到每个位置的目标类别概率向量 和边界框预测向量 ,计算过程表示为:;

其中,softmax是归一化函数,将向量中的元素转换为概率值, 和 是全连接层的权重矩阵、 和 是全连接层的偏置向量;

最终得到模型输出预测向量组,每个元素表示为 ,其中, 和

表示边界框左上角坐标, 和 表示边界框右下角坐标, 为最高概率类别标签, 为对应的置信度,若置信度 大于设定阈值,直接输出预测框和类别标签,否则,输入CLIP多模态模型进行二次分类。

5.根据权利要求4所述的一种无人机场景下基于多模态的开放词集目标检测方法,其特征在于,所述S4的具体方法如下:(1)文本端编码,定义一个类别标签集 ,包含所有可能的物体类别标签,包含但不局限于已知类别,其中, 表示第i个类别,对于每张待检测图像 ,都有对应的拍摄环境信息E,定义一个固定语言模板template,将类别标签、拍摄环境信息和模板进行语义拼接,形成一段完整的自然语言描述 ,得到与类别标签集大小相同的语言提示集 ,将语言提示集 输入文本编码器转化为词嵌入向量进行自注意力计算形成一组文本特征向量嵌入;

(2)图像端编码,对于每张待检测图像 输入图像编码器,预处理后通过卷积计算并展平得到图像的特征表示,再特征映射为一个图像特征向量嵌入 ;

(3)通过步骤(1)(2)得到指定图像特征向量嵌入 和一组文本特征向量嵌入;分别计算图像特征向量嵌入与所有文本特征向量嵌入之间的余弦相似度,所述余弦相似度计算公式为:;

其中, 为图像特征向量和文本特征向量的内积, 为向量的模

长,将余弦相似度与设定阈值对比,预测图像 是否属于类别 的过程表示为:;

即余弦相似度高于预定阈值,则预测图像 属于类别 ,否则,预测不属于该类别,其中,  表示阈值。