1.一种基于文本生成和迭代匹配的图文检索方法,其特征在于:所述基于文本生成和迭代匹配的图文检索方法,包括:S1、利用BI‑GRU网络模型和CNN网络模型依次提取出初始文本特征向量和初始图像特征向量,包括:令初始图像特征向量为 ,初始文本特征向量为
,其中, 表示 维的向量, 表示初始图像特征向量中的第 个图像特征, 表示图像特征数量, 表示初始文本特征向量中的第 个文本特征,表示文本特征数量;
S2、分别对BI‑GRU网络模型和CNN网络模型进行如下训练:S2.1、基于初始文本特征向量,对初始图像特征向量中的每一项图像特征,进行图像特征迭代融合操作,获取融合后的图像特征向量,并进行 次迭代融合,得到经过 次迭代融合后的图像特征向量;
S2.2、基于初始图像特征向量,对初始文本特征向量中的每一项文本特征,进行文本特征迭代融合操作,获取融合后的文本特征向量,并进行 次迭代融合,得到经过 次迭代融合后的文本特征向量;
S2.3、利用分别经过 次迭代融合后的图像特征向量和文本特征向量设计三元组损失函数优化迭代融合操作过程;
S2.4、将经过 次迭代融合后的图像特征向量输入至包括编码器和解码器的文本生成模块中,生成文本特征序列,并设计损失函数优化文本生成模块;
S3、将待检索的图像或文本对应输入至训练好的CNN网络模型或BI‑GRU网络模型中,对应输出图像特征或文本特征;
S4、将输出的图像特征或文本特征与数据库中文本特征或图像特征进行余弦相似度计算,并将数据库中相似度最大的前若干名的文本特征或图像特征作为检索的结果输出。
2.如权利要求1所述的基于文本生成和迭代匹配的图文检索方法,其特征在于:所述基于初始文本特征向量,对初始图像特征向量中的每一项图像特征,进行图像特征迭代融合操作,获取融合后的图像特征向量,并进行 次迭代融合,得到经过 次迭代融合后的图像特征向量,包括:在进行第 次迭代融合的图像特征向量表示为 ,其中表示迭代次数,且 , 表示在进行第 次迭代融合的图像特征向量中的第个图像特征;
S2.1.1、对于第 次迭代融合,使用余弦函数分别计算每个图像特征 与初始文本特征向量 中每个文本特征 的相似性 ,且计算公式如下:;
其中,表示转置, 表示余弦函数;
S2.1.2、然后对相似性 进行相似度归一化,且计算公式如下:;
其中, 表示相似性 进行相似度归一化后的, 表示激活函数;
S2.1.3、对每个图像特征 ,采用自适应方法,通过softmax函数分别计算每一个图像特征 与初始文本特征向量 中每个文本特征 的关系权重 ,即注意力值,且计算公式如下:;
其中, 表示用于调整注意力分布的温度系数, 表示第 次迭代融合中图像特征向量 中第 个图像特征 与初始文本特征向量 中第 个文本特征 的关系权重;
S2.1.4、通过跨模态注意力机制让每个图像特征分别与每个文本特征都进行交互,以加权求和的方式计算出一个图像特征 在初始文本特征向量 中的上下文关系 ,且计算公式如下:;
其中, 表示第 次迭代融合中第 个图像特征 与初始文本特征向量 的上下文关系图像特征;
则第 次迭代融合的图像特征向量 与初始文本特征向量 的上下文关系图像特征向量 ;
S2.1.5、利用门控机制将每个图像特征 分别与每个上下文关系图像特征 进行特征蒸馏,得到蒸馏后的图像特征 ,且公式表示如下:;
其中, 表示门控机制;
然后聚合图像特征向量 和上下文关系图像特征向量 ,得到蒸馏后的图像特征向量,且为第 次迭代融合后的图像特征向量,并作为下一次图像特征迭代融合的输入;
将得到上下文关系图像特征向量的过程和图像特征蒸馏的过程依次循环迭代 次,得到经过 次迭代融合后的图像特征向量。
3.如权利要求2所述的基于文本生成和迭代匹配的图文检索方法,其特征在于:所述基于初始图像特征向量,对初始文本特征向量中的每一项文本特征,进行文本特征迭代融合操作,获取融合后的文本特征向量,并进行 次迭代融合,得到经过 次迭代融合后的文本特征向量,包括:在进行第 次迭代融合的文本特征向量表示为 , 表示在进行第 次迭代融合的文本特征向量中的第 个文本特征;
S2.2.1、对于第 次迭代融合,使用余弦函数分别计算每个文本特征 与初始图像特征向量 中的每个图像特征 的相似性 ,且计算公式如下:;
S2.2.2、然后对相似性 进行相似度归一化,且计算公式如下:;
其中, 表示相似性 进行相似度归一化后的;
S2.2.3、对每个文本特征 ,采用自适应方法,通过softmax函数分别计算每一个文本特征 与初始图像特征向量 中的每个图像特征 的关系权重 ,即注意力值,且计算公式如下:;
其中, 表示第 次迭代融合中文本特征向量 中第 个文本特征 与初始图像特征向量 中第 个图像特征 的关系权重;
S2.2.4、通过跨模态注意力机制让每个图像特征分别与每个文本特征都进行交互,以加权求和的方式总结出一个文本特征 在初始图像特征向量 中的上下文关系 ,且计算公式如下:;
其中, 表示第 次迭代融合中第 个文本特征 与初始图像特征向量 的上下文关系文本特征;
则第 次迭代融合的文本特征向量 与初始图像特征向量 的上下文关系文本特征向量 ;
S2.2.5、利用门控机制将每个文本特征 分别与每个上下文关系文本特征 进行特征蒸馏,得到蒸馏后的文本特征 ,且公式表示如下:;
然后聚合文本特征向量 和上下文关系图像特征向量 ,得到蒸馏后的文本特征向量,且为第 次迭代融合后的文本特征向量,并作为下一次文本特征迭代融合的输入;
将得到上下文关系文本特征向量的过程和文本特征蒸馏的过程依次循环迭代 次,得到经过 次迭代融合后的文本特征向量。
4.如权利要求3所述的基于文本生成和迭代匹配的图文检索方法,其特征在于:所述利用分别经过 次迭代融合后的图像特征向量和文本特征向量设计三元组损失函数优化迭代融合操作过程,包括:对于第 次迭代融合,计算迭代融合后的图像特征向量中图像特征 与上下文关系图像特征 的相似度,以及计算迭代融合后的文本特征向量中文本特征 与上下文关系文本特征 的相似度,然后相加得到第 次迭代融合的整体图像‑文本相似度 ,且公式如下:;
其中,表示整体图像,表示整体文本;
经过 次迭代后将所有的整体图像‑文本相似度求和,得到图像和文本之间总的相似度,且公式如下:;
得到小区域强负样本的三元组损失 :
;
其中, 保证值不为负,表示边缘因子, 表示整体图像的负样本,表示整体文本的负样本。
5.如权利要求4所述的基于文本生成和迭代匹配的图文检索方法,其特征在于:所述将经过 次迭代融合后的图像特征向量输入至包括编码器和解码器的文本生成模块中,生成文本特征序列,包括:所述编码器的第一层为Linear层,所述编码器的第二层为第一GRU层;
所述解码器的第一层为嵌入层,所述解码器的第二层为Dropout层,所述解码器的第三层为第二GRU层;
首先将经过 次迭代融合后的图像特征输入至编码器的Linear层并经过Dropout操作输出第一图像特征;
然后将第一图像特征输入至第一GRU层,第一GRU层利用图像特征转换函数 将输入的第一图像特征中的各特征转变为一个固定维度的向量 , ,且第一图像特征中的所有特征都完成转变得到序列特征空间 ,其中 表示总步长数;
将各向量 输入至解码器中,且依次经过嵌入层、Dropout层和第二GRU层处理,并且在第二GRU层中用当前时间步对应的文本特征 和前一个隐藏单元生成的隐藏状态 ,生成包含了上文信息的隐藏状态向量 ,每个时间步长对应一个隐藏单元,且用函数表示如下:;
计算每个生成时间步长 上对应的正确文本特征的生成概率:通过向量点积计算当前隐藏状态 与词汇表中每个文本特征嵌入向量的相似度,并且将相似度作为每个文本特征类别的生成概率 ,且计算公式如下: (1);
其中,表示包含 个文本特征的词汇表, 表示词汇表 中每个文本特征 的学习嵌入向量;
将词汇表中的 个文本特征看成 个类别,在第 个时间步长上,根据由 个文本特征组成以one‑hot编码的样本真实文本特征分布向量 ,通过公式(1)得到当前时间步长 上生成文本特征的概率分布向量为 ,其中中的最大值 即为每个生成时间步 上对应的正确文本特征 的生成概率;
完成 个时间步的计算,由每个时间步隐藏状态序列 和公式(1),得到每个时间步生成文本特征的概率分布向量序列 ,然后取每个时间步 上的最大值 对应的正确文本特征 ,最终生成了对应的生成文本序列 。
6.如权利要求5所述的基于文本生成和迭代匹配的图文检索方法,其特征在于:所述设计损失函数优化文本生成模块,包括:最小化每个时间步长生成文本特征的概率分布向量和真实文本特征分布向量的交叉熵,然后通过累加每个时间步长得到整个句子的损失值 :;
其中,表示优化参数, 表示第 个真实文本特征分布向量, 表示第 个生成文本特征的概率分布向量。
7.如权利要求6所述的基于文本生成和迭代匹配的图文检索方法,其特征在于:所述BI‑GRU网络模型和CNN网络模型训练过程的整体损失 设计如下:使用超参数 来聚合三元组损失与文本生成模块的损失,且具体公式如下:。