利索能及
我要发布
收藏
专利号: 2025118532171
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-12
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种面向空对地无人机视频的语义驱动跨视角匹配方法,其特征在于包括以下步骤:(1)获取图像帧与参考图,并进行尺度对齐、颜色格式转变的预处理,输出预处理图像;

(2)将预处理图像和预设类别文本输入预训练CLIP模型,生成图像特征与预设类别文本特征,计算两种特征的余弦相似度作为置信度,当最高置信度≥阈值 时,输出语义触发信号、触发帧图像的位置;

(3)触发帧图像和参考图依据CLIP提取补丁特征,计算补丁特征与触发类别文本特征的相似度生成补丁热图,补丁热图上采样至LoFTR粗级分辨率得到语义掩码;

(4)对触发帧图像和参考图都提取粗级特征图和细级特征图,在粗级别匹配阶段:使用加权因子将语义掩码作用于粗级特征图得到强化特征图,然后基于双归一化与互最近邻筛选粗级别匹配点;在细级别匹配阶段:将粗级别匹配点映射到细级特征图中,在局部窗口内做相关性估计与期望求解,得到亚像素级位置,再进行可视化处理。

2.根据权利要求1所述的一种面向空对地无人机视频的语义驱动跨视角匹配方法,其特征在于所述步骤(1)具体包括:获取无人机视频流的每一帧图像及一个参考图作为输入;

按短边缩放并必要时等边填充实现尺度对齐;将输入由BGR或灰度统一为RGB;输出预处理图像。

3.根据权利要求1或2任一权利要求所述的一种面向空对地无人机视频的语义驱动跨视角匹配方法,其特征在于所述参考图为人工选取的包含目标的一帧图像。

4.根据权利要求1所述的一种面向空对地无人机视频的语义驱动跨视角匹配方法,其特征在于所述步骤(2)中预设类别文本包括一个或多个预定义目标类别。

5.根据权利要求1所述的一种面向空对地无人机视频的语义驱动跨视角匹配方法,其特征在于所述阈值 可自定义。

6.根据权利要求1所述的一种面向空对地无人机视频的语义驱动跨视角匹配方法,其特征在于所述步骤(3)具体包括以下步骤:(3.1)CLIP分别将触发帧图像和参考图划分为若干个补丁,并对每个补丁输出补丁特征;

(3.2)获取触发类别文本特征;

(3.3)将触发类别文本特征与各补丁特征逐一计算相似度,形成补丁热图,将补丁热图上采样至LoFTR粗级分辨率得到语义掩码,所述LoFTR粗级分辨率为触发帧图像的下采样1/

8。

7.根据权利要求1所述的一种面向空对地无人机视频的语义驱动跨视角匹配方法,其特征在于所述步骤(4)中,所述对触发帧图像和参考图下采样1/8提取到粗级特征图、下采样1/2提取到细级特征图,相应的两组粗级特征图表示为 、 ,细级特征图表示为 、。

8.根据权利要求1所述的一种面向空对地无人机视频的语义驱动跨视角匹配方法,其特征在于所述步骤(4)中,粗级别匹配阶段的具体步骤包括:(4.1a)使用加权因子将语义掩码作用于粗级特征图 、 ,得到注意力增强的强化特征图 、 ;

(4.1b)计算 、 的相似度矩阵S再做归一化得到匹配置信度矩阵;

(4.1c)根据匹配置信度矩阵筛选出高置信度的粗级别匹配点后,应用互最近邻约束取出不一致对,同时记下粗级别匹配点的中心与其置信度。

9.根据权利要求8所述的一种面向空对地无人机视频的语义驱动跨视角匹配方法,其特征在于,所述步骤(4.1a)具体包括:将  、  的特征展平并添加正弦位置编码后输入粗级别Transformer编码器,利用自注意力和交叉注意力机制完成同图全局聚合与跨图对齐增强,输出上下文增强后的强化特征图 、 。

10.根据权利要求1所述的一种面向空对地无人机视频的语义驱动跨视角匹配方法,其特征在于所述步骤(4)中,细级别匹配阶段的具体步骤包括:(4.2a)将粗级别匹配点映射到细级特征图,并以粗级别匹配点的位置为中心锚点裁剪两组固定尺寸窗口得到局部特征图;

(4.2b)将局部特征图送入细级别Transformer编码器, 利用自注意力和交叉注意力机制得到局部精细特征图 和 ;

(4.2c)计算 中心向量与 所有向量的关联性,得到局部概率热图,对局部概率热图做概率期望得到亚像素偏移 ,叠加到细级别中心坐标以此得到细级别坐标;

(4.2d)将细级别坐标按特征金字塔比例恢复到原图坐标,输出细级别匹配点及其置信度,并绘制匹配可视化效果。