利索能及
我要发布
收藏
专利号: 2022105047973
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于注意力机制的无监督图像语义分割方法,其特征在于,所述方法包括以下步骤:S1:获取仿射变换矩阵θ,首先,θ被初始化为恒等变换矩阵,通过损失函数不断更正θ的参数,最终得到期望的仿射变换矩阵;

S2:RGB图像U输入后,根据上一阶段的到的仿射变换矩阵,计算的到特征图V的坐标点对应的输入图像U的坐标点的位置,计算方法如下:其中, 代表像素的位置,s代表输入特征图像坐标点,t代表输出特征图坐标点,Aθ是S1阶段得到的仿射变换;

S3:利用插值的方式计算输出特征图中某个特定像素点的灰度值,计算方法如下:c

式中W和H代表输入图像的宽度和高度,Vi 是通道c中位置 的像素i的灰度值,为输入特征图上第c个通道点(n,m)的灰度值;

S4:使用特征提取模块对输入图像提取深层特征{xn};

S5:一维卷积层计算q维类别空间中的特征响应向量{rn};

S6:特征响应向量{rn}在像素类别空间各轴上使用批归一化函数得到{r′n},使{r′n}具有零均值和单位方差;

S7:使用argmax函数,选择在{r′n}中具有最大值的维度来确定每个像素的类别标签{cn};

S8:计算损失函数并进行反向传播更新参数,其中损失函数由特征相似度损失和空间连续性损失组成,μ代表平衡两个损失函数的权重损失函数,定义如下:L=Lsim({r′n,cn})+μLcon({r′n})    (3)其中特征相似度损失函数如下:

其中,

其中,N为输入图像的像素总数,响应图{rn=Wcxn}是通过应用一个线性分类器得到的,q×p其中{Wc∈R },然后,响应图被归一化为{r′n};

空间连续性损失函数定义如下:

式中rξ,η代表响应图{r′n}中(ξ,η)处的像素值;

通过应用空间连续性损失,删除由于复杂的图案或纹理原因而产生的过多的像素标签。

2.如权利要求1所述的一种基于注意力机制的无监督图像语义分割方法,其特征在于,步骤S1中,在二维图像中,仿射变换矩阵θ为2×3的矩阵。

3.如权利要求1或2所述的一种基于注意力机制的无监督图像语义分割方法,其特征在于,步骤S2中,坐标映射关系为目标图片映射到输入图片,原因是坐标映射需要从原图不同坐标上采集像素至目标图片,每次采样都需要遍历目标图片的坐标,而采集的原图片的坐标是不固定的,因此可得变换后的输出特征图每个位置的坐标在输入特征图上的对应坐标点。

4.如权利要求1或2所述的一种基于注意力机制的无监督图像语义分割方法,其特征在于,步骤S3中,当 或者 大于1时,对应的max()项将取0,故只有(xi,yi)周围4个点的灰度值决定目标像素点的灰度,并且当 和 越小,影响越大,即离点(n,m)越近,权重越大。

5.如权利要求1或2所述的一种基于注意力机制的无监督图像语义分割方法,其特征在于,步骤S8中,特征相似度损失函数背后的目标是增强相似特征的相似性,一旦图像像素根据其特征进行聚类,同一类别内的特征向量应该是相互相似的,而不同类别的特征向量应该是相互不同的,通过这个损失函数的最小化,网络权重被更新以促进提取更有效的特征进行分类。