1.一种基于图文匹配的多层次图像特征融合方法,其特征在于,包括以下步骤:S1)、文本表征,预设m1个分词处理好文本数据,分别为 每个文本都有对应的图像,利用文本分析技术为所有文本数据生成相应的特征向量;
S2)、多层次图像表征,具体为:
S201)、预设m2个图像数据,分别为 每个图像都有其对应的文本,在图像分类学习目标的指导下,利用丰富的图像分类数据集,预先训练得到一个预训练卷积神经网络;
S202)、把图像输入到该预训练卷积神经网络中,并对预训练网络中的n层特征进行拼接,以作为图像的多层次总预训练特征;
S3)、为了从多层次的预训练特征中归纳出对图文匹配任务有用的特征和舍弃无用的噪声特征,构建一个多层感知机(Multi-Layer Perceptron,MLP);
S4)、利用图文匹配的学习目标,指导多层感知机MLP对图像的多层次总预训练特征进行融合和降维,生成融合图像特征;
S5)、融合图像特征的运用,直接对融合图像特征和文本特征进行相似度测量,从而进行图文匹配,由于MLP的训练约束能让其输出的融合图像特征向量与文本的特征向量直接在余弦相似度上进行匹配,因此利用在特征空间上的余弦相似度去进行图文匹配。
2.根据权利要求1所述的一种基于图文匹配的多层次图像特征融合方法,其特征在于:步骤S201)中,所述的图像分类数据集为ImageNet数据集。
3.根据权利要求1所述的一种基于图文匹配的多层次图像特征融合方法,其特征在于:步骤S202)中,把图像Ik输入到预训练卷积神经网络中,即可生成对应的多层次总预训练特征 即其中, 为预训练网络中使用到的第i层特征,为了令各层特征能拼接在一起,若使用到的某层特征为卷积层特征,必须要先进行池化操作以消除空间信息,若使用到的某层特征为全连接层特征,则不必进行池化操作。
4.根据权利要求1所述的一种基于图文匹配的多层次图像特征融合方法,其特征在于:步骤S3)中,所述的多层感知机MLP的各层维度随着深度增加相应降低,以满足对高维度且包含大量噪声特征的多层次总预训练特征进行融合和降维的需要,并且该多层感知机MLP的输出层维度与文本特征的维度一致,在多层感知机MLP的隐藏层和输出层设置非线性激活函数,以增强表达能力。
5.根据权利要求1所述的一种基于图文匹配的多层次图像特征融合方法,其特征在于:步骤S4)中,为了训练多层感知机MLP的网络参数,定义一个约束,即:其中, 和 分别代表文本Ti所对应的正类(匹配)和负类(不匹配)的图像集合, 为Ti的特征向量, 和 分别代表图像Ij,Ip的融合图像特征, 代表 的余弦相似度,m为强制间隔大小;
该约束表示,给定训练文本Ti,令其与对应的每个正类图像Ij的特征相似度,都要大于间隔大小m加上其与每个负类图像Ip的特征相似度,通过使用Hinge Loss的标准形式,将约束转化为MLP的训练损失函数,即通过上述损失函数即可使用所有由训练文本,对应的正类图像,以及对应的负类图像所组成的三元组去训练MLP的网络参数。