1.一种基于文本引导的弱监督图像缺陷分割方法,其特征在于:包括如下步骤:S1、获取由若干个工业缺陷图像和对应类别标签组成的工业缺陷图像数据集;
S2、建立图像分割模型并利用工业缺陷图像数据集进行训练,所述图像分割模型包括初步预测模块和文本引导模块,其中:所述初步预测模块执行如下操作:
将工业缺陷图像数据集输入ViT编码器进行特征提取,获得多尺度图像块特征,所述多尺度图像块特征包括N个图像块特征和类标记;
将多尺度图像块特征输入分割解码器获得初步分割预测结果,所述分割解码器包括多个依次连接的卷积模块;
所述文本引导模块执行如下操作:
针对工业缺陷图像数据集中的前景类别和背景类别,分别对应构建前景文本和背景文本;
将全部前景文本和背景文本输入CLIP模型的文本编码器对应生成前景文本特征集合和背景文本特征集合;
将前景文本特征集合和背景文本特征集合拼接后与多尺度图像块特征输入上下文解码器,获得增强前景文本特征集合和增强背景文本特征集合;
根据多尺度图像块特征、增强前景文本特征集合和增强背景文本特征集合获得图文相关性得分图;
将初步分割预测结果与图文相关性得分图进行加权,获得最终分割预测结果;
S3、利用训练好的图像分割模型对待分割工业缺陷图像进行检测,获得最终分割预测结果。
2.如权利要求1所述的基于文本引导的弱监督图像缺陷分割方法,其特征在于:所述初步预测模块还执行如下操作:在ViT编码器的中间层的输出端引入辅助分类器,在工业缺陷图像数据集输入ViT编码器时,同时获得辅助分类器的输出特征图,并将辅助分类器的输出特征图利用CAM方法形成辅助类激活图;
采用双阈值划分法对辅助类激活图构建辅助伪标签,并将辅助伪标签中前景区域对应的多尺度图像块特征中的图像块特征作为前景集合,背景区域对应的多尺度图像块特征中的图像块特征作为背景集合;
将多尺度图像块特征输入第一分类器后利用CAM方法形成初始激活图;
采用单阈值划分法对初始激活图构建初始伪标签。
3.如权利要求2所述的基于文本引导的弱监督图像缺陷分割方法,其特征在于:所述ViT编码器执行如下操作:将工业缺陷图像划分为N个不重叠的图像块并展平为第一向量;
通过线性映射函数对第一向量进行投影,获得特征向量;
将特征向量与引入的类特征向量拼接后输入特征提取器,获得多尺度图像块特征,其中,为第 个图像块特征,n=1 N, 为类标记,所述~
特征提取器为由12层依次连接Transformer模块组成的Transformer编码器,所述类特征向量为1×C的一维向量,其中对应工业缺陷图像所属缺陷类别的元素记为1,其余记为0,C为全部类别标签中缺陷类别的总数。
4.如权利要求3所述的基于文本引导的弱监督图像缺陷分割方法,其特征在于:所述辅助分类器为全连接层并与所述ViT编码器的第10层Transformer模块的输出端连接。
5.如权利要求2所述的基于文本引导的弱监督图像缺陷分割方法,其特征在于:所述第一分类器用于执行如下操作:将多尺度图像块特征和第一分类器的权重进行点积操作获得线性相关性映射图,其中,N为多尺度图像块特征 中的图像块特征的数量,为全部类别标签中缺陷类别的总数;
将线性相关性映射图 经ReLU激活函数后获得响应图,并对响应图进行最大值归一化处理,获得初始激活图 , 为线性相关性映射图 的高度, 为线性相关性映射图 的宽度。
6.如权利要求2所述的基于文本引导的弱监督图像缺陷分割方法,其特征在于:所述采用双阈值划分法对辅助类激活图构建辅助伪标签,具体如下:当辅助类激活图中第k个像素点的值小于等于预设下限阈值时,认为对应像素点为背景区域,标记为0;当辅助类激活图中第k个像素点的值大于等于预设上限阈值时,认为对应像素点为前景区域,标记为1,k=1 K,K为辅助类激活图的像素点总数;否则,认为对应像素~点为不确定区域,标记为255,并比较辅助伪标签中对应像素点的预设数量的邻域像素点的值,当等于1的占比小于等于预设比值时,认为对应像素点为背景区域,当等于1的占比大于预设比值时,认为对应像素点为前景区域;
所述采用单阈值划分法对初始激活图构建初始伪标签,具体如下:判断初始激活图中各像素点的值是否在预设划分阈值内,若是,认为对应像素点为背景区域,标记为0,若否,认为对应像素点为前景区域,标记为1。
7.如权利要求2所述的基于文本引导的弱监督图像缺陷分割方法,其特征在于:所述图像分割模型还包括多层级对比优化模块和总损失计算模块,其中:所述多层级对比优化模块包括全局块间特征对比模块、局部‑全局特征对比模块和图像‑文本语义对比模块,其中所述全局块间特征对比模块用于基于余弦相似度分别计算前景集合内的图像块特征的块间相似度、以及前景集合和背景集合间的图像块特征的异类相似度,并实现最大化块间相似度的同时最小化异类相似度生成块间对比损失函数;
所述局部‑全局特征对比模块执行如下操作:
将多尺度图像块特征中的类标记与文本嵌入投影到同一空间获得第一特征;
在工业缺陷图像中以尺寸H×W多次随机裁剪形成Q个局部图像块,并在辅助伪标签上裁剪出与Q个局部图像块对应的标签块,其中,H为局部图像块的高度,W为局部图像块的宽度,Q为正整数;
将Q个局部图像块输入ViT编码器获得第一提取特征,并将第一提取特征的对应标签块中前景区域的特征作为第一视觉特征,背景区域的特征作为第二视觉特征;
根据辅助伪标签、第一视觉特征、第二视觉特征、第一特征生成InfoNCE对比损失,所述文本嵌入为拼接后的增强前景文本特征集合和增强背景文本特征集合;
所述图像‑文本语义对比模块用于最大化第一特征与增强前景文本特征集合的余弦相似度,同时最小化第一特征与增强背景文本特征集合的余弦相似度生成图文对比损失函数;
所述总损失计算模块用于构建总损失函数,所述总损失函数由第一分类损失、第二分类损失、块间对比损失函数、InfoNCE对比损失、图文对比损失函数和分割损失加权获得,其中:所述第一分类损失用于根据第一分类器的输出特征图和对应类别标签计算多标签交叉熵损失以监督第一分类器;
所述第二分类损失用于根据辅助分类器的输出特征图和对应类别标签计算多标签交叉熵损失以监督辅助分类器;
所述分割损失用于将分割解码器的输出特征图与初始伪标签进行逐像素对比计算交叉熵损失以监督分割解码器。
8.如权利要求1所述的基于文本引导的弱监督图像缺陷分割方法,其特征在于:所述分割解码器包括三个依次连接的卷积模块,其中,第一个卷积模块和第二个卷积模块均包括依次连接的卷积层和ReLU激活函数,第三个卷积模块包括卷积层;所述上下文解码器包括个依次连接的Transformer模块, 为正整数;所述前景文本和背景文本采用预设的自然语言模板构建。
9.如权利要求1所述的基于文本引导的弱监督图像缺陷分割方法,其特征在于:所述根据多尺度图像块特征、增强前景文本特征集合和增强背景文本特征集合获得图文相关性得分图,具体如下:将增强前景文本特征集合和增强背景文本特征集合拼接形成文本嵌入;
将归一化后的多尺度图像块特征与归一化后的文本嵌入进行爱因斯坦求和操作,获得图文相关性得分图。
10.一种基于文本引导的弱监督图像缺陷分割系统,基于权利要求1‑9任一所述的基于文本引导的弱监督图像缺陷分割方法,其特征在于:包括数据获取模块、模型构建模块和模型预测模块,其中:所述数据获取模块,用于获取由若干个工业缺陷图像和对应类别标签组成的工业缺陷图像数据集;
所述模型构建模块,用于建立图像分割模型并利用工业缺陷图像数据集进行训练,所述图像分割模型包括初步预测模块和文本引导模块,其中:所述初步预测模块执行如下操作:
将工业缺陷图像数据集输入ViT编码器进行特征提取,获得多尺度图像块特征,所述多尺度图像块特征包括N个图像块特征和类标记;
将多尺度图像块特征输入分割解码器获得初步分割预测结果,所述分割解码器包括多个依次连接的卷积模块;
所述文本引导模块执行如下操作:
针对工业缺陷图像数据集中的前景类别和背景类别,分别对应构建前景文本和背景文本;
将全部前景文本和背景文本输入CLIP模型的文本编码器对应生成前景文本特征集合和背景文本特征集合;
将前景文本特征集合和背景文本特征集合拼接后与多尺度图像块特征输入上下文解码器,获得增强前景文本特征集合和增强背景文本特征集合;
根据多尺度图像块特征、增强前景文本特征集合和增强背景文本特征集合获得图文相关性得分图;
将初步分割预测结果与图文相关性得分图进行加权,获得最终分割预测结果;
所述模型预测模块,用于利用训练好的图像分割模型对待分割工业缺陷图像进行检测,获得最终分割预测结果。