利索能及
我要发布
收藏
专利号: 2024107332976
申请人: 江苏建筑职业技术学院
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种全景分割与多视觉特征协同的图像描述生成方法,其特征在于,包括:提取输入图像的网格特征G和基于全景分割的掩膜特征M并编码;

通过双流交叉注意力将文本语义特征与网格特征G和掩膜特征M进行交叉融合;

采用kMaX‑DeepLab全景分割网络生成掩膜特征M,包括:步骤S121,通过像素编码器获取输入图像I的图像特征F;

步骤S122,采用像素解码器对图像特征F进行上采样提取像素特征;

步骤S123,采用kMaX解码器将随机初始化的聚类中心转换为掩膜嵌入向量;

步骤S124,掩模嵌入向量与像素特征相乘获得分割特征S;

步骤S125,图像特征F与分割特征S进行池化操作生成最终的掩膜特征MM(N,DM)=∑hwS(N,h,w)·F(h,w,DM) (2)H×W

其中,S=(s1,s2,...,sN),sl∈{0,1} 表示掩膜矩阵,l表示分割区域的索引号,每个元素表示对应的像素点是否属于某一实例对象,N表示图像中分割的区域的个数,每张图的数量不固定,DM表示每个分割区域对应的视觉特征维度,与特征图F的特征维度一致,h和w表示每个分割区域的对应的行号和列号,H和W分别为表示输入图像的高度和宽度;

文本语义Xi特征的获取方法包括:

步骤S201,通过将词嵌入向量和位置编码相加得到单词特征X=(x1,x2,...,xT),其中T为句子长度,即单词的个数;

步骤S202,将单词特征送入解码器,在每个解码层中,通过自注意力模块对单词特征进行编码,得到语义特征Xi:Xi=MultiHead(Xi,Xi,Xi) (3)Xi=Xi+LayerNorm(Xi) (4)其中,i表示解码层索引号,MultiHead(·)表示Transformer多头注意力操作,LayerNorem(·)表示归一化操作;

双流交叉注意力将文本语义特征与网格特征G和掩膜特征M进行交叉融合的过程包括:在第i个解码层中,网格视觉特征Gi与掩膜视觉特征Mi作为键‑值分别输入两个多头注意力模块,文本语义特征Xi作为查询向量,得到掩膜视觉特征Mi与文本语义特征Xi的融合特征 以及网格视觉特征Gi与文本语义特征Xi的融合其中,αM和αG为双流权重,WM,WG表示可学习的权重参数,bM,bG表示可学习的偏差参数,由Sigmoid激活函数σ(·)分别计算获得;

获得双流融合特征Ri

表示点积运算;

双流融合特征Ri经过残差归一化操作后再输入前向反馈层形成下一个解码层的输入Xi+1=FeedForward(Xi+Layernorm(Ri))最后一层解码块的输出经过Generator预测单词输出Xi。

2.根据权利要求1所述的方法,其特征在于,采用Swin注意力机制获取输入图像的网格特征G,包括:步骤S111,将输入图像I通过patch partition层分割成非重叠的小块;

步骤S112,将每个小块通过线性嵌入层映射到一个维度为C的低维空间中生成块嵌入向量;

步骤S113,对块嵌入向量进行四阶段的下采样,得到形状为H×W×DG的网格特征G

3.根据权利要求1所述的方法,其特征在于,步骤S202中对单词特征进行掩码自注意力机制操作,再经过残差归一化操作得到语义特征Xi。

4.根据权利要求3所述的方法,其特征在于,对单词特征进行掩码自注意力机制操作前进行位置编码操作,获取单词的顺序位置信息pos其中,pos代表当前单词在序列中的位置,j是嵌入维度的索引,d是嵌入的维度。