1.一种注意力相似度迁移的跨模态哈希检索方法,其特征在于,包括以下步骤:S1:获取多模态数据,并对数据进行预处理得到统一大小的图像和去除标点的文本;
S2:对经过预处理后的多模态数据进行特征提取,提取出相应的文本特征向量和图像特征图;
S3:设计包含了通道注意力子分支和空间注意力子分支的混合自注意力机制,将图像特征图利用混合自注意力机制分配自注意力权重,利用多头注意力机制对文本特征向量分配自注意力权重,并根据自注意力权重大小分别强化关注图像和文本的关键特征;具体操作步骤为:S31:对于输入的图像特征图Fmap,在通道注意力子分支,首先进行全局平均池化,避免空间信息对注意力的影响,依次经过全连接层、Relu激活函数、全连接层、BN层处理,得到通道注意力子分支掩码Mc:Mc=BN(FC(Rule(FC(GAP(Fmap)))式中,FC代表全连接层,GAP代表全局平均池化;
对于空间注意力子分支,首先将图像特征图Fmap经过1*1*1卷积层组合成单通道的特征融合图,去掉通道后得到特征矩阵F0,避免通道信息分布对空间注意力权重的影响;将F0经softmax函数计算获得全局相关性矩阵F1,F0和F1对应元素相乘,获得全局特征矩阵,输入到BN层获得空间注意力子分支掩码,公式表示如下:F0=Conv1*1*1(Fmap)
F1=softmax(F0)
Ms=BN(F0*F1)
式中,Conv1*1*1表示1*1*1卷积,Ms表示空间注意力子分支掩码;
S32:将通道注意力子分支掩码和空间注意力子分支掩码按比例计算得到混合自注意力机制掩码,处理得到经混合自注意力机制强化关注的图像关键特征Fi,公式表示如下:Fi=Fmap(1+α(a*Mc+β*Ms))
式中,α和β为学习得到的可变权重,σ代表Sigmoid函数;
S33:通过Bi‑LSTM输出包含所有时间步的输出O={O1,O2,...,Ot,...,Om},其中Om代表第m个时间步的输出向量,以及最后一个时间步的隐藏状态Hm,为了实现多头注意力机制,将输入的向量看作
Vt=ωVOt
K=ωKOt
式中,ωQ、ωV、ωK为网络参数,随反向传播而修改,Ot代表第t个时间步的输出,Vt代表T第t个时间步的Value值,K代表K的转置,dx代表x维向量;
S34:将各时间步权重值与Value值加权求和,得到带有单头自注意力的文本特征向量zy:式中,zy代表第y个单头注意力计算结果;
S35:将步骤S33和S34进行h次,得到多头自注意力文本{z1,z2...,zy,...zh},其中zh代表第h个单头注意力计算结果,将其拼接并做一次线性变换后得到带有多头自注意力的文本特征向量Ft:Ft=Concat(z1,z2,...,zy,...,zh)ωz式中,ωz为网络参数,h为自注意力的头数;
S4:将经过强化关注得到的图像和文本的关键特征,进行多模态共同注意力机制处理,减少图像和文本通道之间的信息不平衡,加强多模态信息交互,并将多模态数据特征映射至公共实值空间;
S5:计算公共实值空间的特征相似度,利用迁移学习和哈希函数,将相似关系从公共实值空间迁移至哈希空间,训练得到哈希码;具体操作步骤为:S51:利用余弦相似度公式,计算公共实值空间中模态内相似度SD:式中,j和n代表第j和第n个实例, 表示第j个具有共同注意力的文本特征或图像特征, 表示第n个具有共同注意力的文本特征或图像特征,D∈{I,T},表示文本模态T与图像模态I, 代表 的转置矩阵, 表示 的F‑范数;
S52:为了便于反向传播,使用以下公式作为哈希函数,计算具有共同注意力的文本和图像特征的哈希码BD:k
BD=tanh(ρWD)∈[‑1,1]
式中,WD表示具有共同注意力的文本特征或图像特征,D∈{I,T},表示文本模态T与图像模态I,ρ为可变参数,k为哈希码的长度;
计算哈希空间内相似度H:
式中, 表示第n个实例的哈希码, 表示第j个实例的哈希码,T代表转置;
S53:根据多模态在公共实值空间内的数据分布,采用相似度重建的方式保持相似关系,将各模态内成对的相似度值迁移至哈希空间,模态内损失函数Sintra表示为:式中,Si代表公共实值空间内图像实例的相似度,St代表公共实值空间内文本实例的相似度,Hi代表哈希空间内图像实例的相似度,Ht代表哈希空间内文本实例的相似度,ω和γ为可学习的参数,代表各模态的模态内损失函数占模态内损失函数的比例;
S54:模态间相似度迁移利用成对多模态信息进行计算,由于相同模态的同语义实例的特征关系矩阵对角线为1,而不同模态存在语义鸿沟,所以在此约束模态间最大相似度为1,模态间相似度迁移损失函数Sinter为:式中,1表示长度为L的单位向量,BI代表图像实例的哈希码,BT代表文本实例的哈希码,diag(·)函数表示矩阵的对角线元素组成的向量;
S55:最终损失函数loss为:
loss=minμSinter+(1‑μ)Sintra式中,μ为可学习的参数,代表各损失函数的比例;
S6:根据得到的哈希码计算相似度,并进行排序,选择排名前n个候选集实例作为最终的查询结果。
2.根据权利要求1所述的一种注意力相似度迁移的跨模态哈希检索方法,其特征在于,在步骤S2中,对于图像数据使用Resnet‑50神经网络提取图像特征图,对于文本数据采用Bi‑LSTM模型提取特征向量。
3.根据权利要求1所述的一种注意力相似度迁移的跨模态哈希检索方法,其特征在于,步骤S4的具体操作步骤为:S41:对于输入的图像关键特征Fi,利用得softmax函数计算,到图像特征注意力分布Ai:Ai=softmax(Fi)
对于输入的文本关键特征Ft,利用softmax函数,得到文本特征注意力分布At:At=softmax(Ft)
S42:将图像关键特征Fi与文本特征注意力分布At相乘得到具有共同注意力的图像特征WI:式中,表示Hadamard乘积;
将文本关键特征Ft与图像特征注意力分布Ai相乘得到具有共同注意力的文本特征WT:S43:将具有共同注意力的图像特征WI和文本特征WT经过全连接层处理,映射至k维的公共实值空间,其中k为哈希码的长度。