利索能及
我要发布
收藏
专利号: 202411438579X
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于图片映射器和文本自遮掩映射器的组合图像检索方法,其特征在于,使用图片和图片标题文本训练图片映射器以及文本自遮掩映射器,包括以下步骤:步骤1,读取数据集,将图片和图片标题文本作为模型的数据输入;具体包括:步骤1.1,先将图片缩放到预定的大小,并执行水平翻转、随机增加高斯噪声进行数据增强;

步骤1.2,利用自然语言工具中的标记提取器从图片标题文本中提取关键词,将提取出的关键词加入到一个列表中并进行去重,得到一个关键词列表,这个列表中记录了所述图片标题文本中包含的所有关键字;

步骤1.3,遍历关键词列表,将图片标题文本中的关键词替换为‘[ ]’符号,获得新的文本描述;

步骤2,训练图片映射器 ,将图像特征转化为伪语言标记嵌入: 其中s为伪语言标记嵌入,为图像特征;具体包括:步骤2.1,将输入图片经过冻结的视觉编码器 处理得到图像特征 ;

步骤2.2,构建一个具有参数M的图片映射器 ;

步骤2.3,利用图片映射器 将图像特征 转化为伪词标记s;

步骤2.4,构建文本提示:“A photo of”,在其后面拼接上由图像特征 转化成的伪词标记s得到拼接后的文本 :“A photo of [s]”;

步骤2.5,将拼接文本 输入冻结的文本编码器 得到拼接后的文本特征 :;

步骤2.6,最小化相对于映射器的对比损失使得相似的图像和文本在同一个嵌入空间中更加接近,不相似的更加远离;

对比损失的函数表达式如下:

其中, 表示从文本到图像的对比损失, 表示从图像到文本的对比损失,是一个温度参数,用于缩放相似性分数, 表示一个训练批次中的样本数量, 是对 进行归一化得到;

步骤3,采用添加噪声的方法,弥合纯文本和图片之间的模态差距;具体包括:步骤3.1,将输入的文本 经过冻结的预训练文本编码器 得到文本特征 ;

步骤3.2,对文本特征 添加噪声n;

步骤4,训练文本自遮掩映射器 ,通过纯文本训练捕获图片中的信息;具体包括:步骤4.1,构建一个具有参数N的文本自遮掩映射器 ;

步骤4.2,利用文本自遮掩映射器 将步骤3.2中添加过噪声的文本特征 转化为伪词标记 : ;

步骤4.3,利用步骤1.3中得到的与该图片标题文本对应的由‘[ ]’符号替换掉关键词的文本描述,将伪词标记 替换掉其中所有的‘[ ]’符号,记为 ;

步骤4.4,将 输入到冻结的预训练文本编码器 得到文本特征 ;

步骤4.5,对于得到的两个文本特征 和 ,最小化二者之间的均方差损失来训练文本自遮掩映射;

均方差损失函数表达式如下:

步骤5,根据步骤2、步骤4中的两种损失函数,利用反向传播算法和梯度下降算法,对模型进行优化;

步骤6,测试模型。

2.如权利要求1所述的一种基于图片映射器和文本自遮掩映射器的组合图像检索方法,其特征在于:步骤5具体包括:步骤5.1,根据实际输入与期望输出,得到总体的误差公式,其公式为:式中 是计算拼接后的文本特征 与图像特征 的对比损失函数, 是计算文本特征与被伪词标记替换后的文本特征 之间的差异的均方差损失函数;

步骤5.2,利用反向传播算法和梯度下降算法优化模型参数;将batch size设置为64,‑5使用Adam优化器,网络初始学习率设置为1 10 ,权重衰减为0.01,并采用概率50%的Dropout进行正则化,总共训练60个轮次。

3.如权利要求1所述的一种基于图片映射器和文本自遮掩映射器的组合图像检索方法,其特征在于:步骤6具体包括:步骤6.1,提供提示文本,将数据集中的图片经过冻结的预训练视觉编码器,得到的特征作为查询集;

步骤6.2,将输入数据中的图片首先经过冻结的预训练视觉编码器提取特征 ,将 分别输入到图片映射器 和文本自遮掩映射器 中,分别得到伪词s1和s2,分别将其替换预先提供的提示文本中的‘[ ]’符号,并将数据中的文本部分拼接到提示文本之后,得到两个新的文本 , ;

步骤6.3,将文本 , 分别输入到冻结的预训练文本编码器 中,得到两个特征,将两个特征进行融合;

步骤6.4,将步骤6.3中得到的融合特征与查询集中的特征进行余弦相似度计算,然后进行排序,得到对应的查询结果。

4.如权利要求1所述的一种基于图片映射器和文本自遮掩映射器的组合图像检索方法,其特征在于:步骤1.1中先将图片缩放到224px 224px的大小,并执行水平翻转,随机增加高斯噪声的方法进行数据增强;

步骤1.2所述的自然语言工具是spaCy自然语言处理库,提取关键字种类为名词或形容词;

步骤1.3替换规则是将图片标题文本中全部的关键词全部替换为‘[ ]’符号。

5.如权利要求1所述的一种基于图片映射器和文本自遮掩映射器的组合图像检索方法,其特征在于:步骤2.1所述的视觉编码器 为ResNet网络,Vision Transformer网络;

步骤2.2所述的图片映射器 由三层MLP组成,其中包含512个隐藏单元,并使用ReLU激活函数;

步骤2.5所述的文本编码器 为Transformer网络。

6.如权利要求2所述的一种基于图片映射器和文本自遮掩映射器的组合图像检索方法,其特征在于:步骤3.2添加的噪声为 ,即随机标量乘以从高斯分布中抽取出的随机向量;其中 表示均匀分布,意味着这个标量值在0到1之间,任何值出现的概率相同; 为正态分布,每个分量都是独立地从均值为0、方差为

1的正态分布中抽取的;

步骤4.1所述文本自遮掩映射器 由三层MLP组成,使用GeLU激活函数;

步骤5.2具体包括:将批次大小batch size设置为64,使用优化器Adam,网络初始学习‑5率设置为1 10 ,权重衰减为0.01,并采用概率50%的Dropout进行正则化,总共训练60个轮次。