1.一种噪声抑制模态融合对齐的工业图像异常检测方法,其特征在于,包括如下步骤:获取正常工业图像样本和带有标签的异常工业图像样本,构建数据集,并按照比例划分为训练集和测试集;
构建工业图像异常检测模型;其中,该工业图像异常检测模型包括文本编码器、双通道图像编码器、MLP模块以及多模态交互模块;
利用训练集对工业图像异常检测模型进行训练;
利用训练后的工业图像异常检测模型对测试集中的图像样本进行异常检测;
利用训练集对工业图像异常检测模型进行训练的步骤包括:构建结构化的正常文本提示模板以及结构化的异常文本提示模板;
将正常文本提示模板及五组带位置信息的异常文本提示模板输入至文本编码器中进行编码,正常文本提示模板通过噪声抑制注意力层编码后输出正常文本嵌入向量 ,五组带位置信息的异常文本提示模板通过噪声抑制注意力层分别编码为异常文本嵌入向量组,对五组异常文本嵌入向量进行均值池化操作,生成融合异常文本嵌入向量 ;将正常文本嵌入向量和融合异常文本嵌入向量拼接,得到文本提示嵌入向量 ,, ,C是嵌入维度,R代表实数矩阵空间;
将训练集中的待检测图像调整为固定分辨率后输入至双通道图像编码器中,得到全局图像嵌入向量、四层补丁级嵌入向量和四层去噪补丁级嵌入向量;
将四层补丁级嵌入向量和四层去噪补丁级嵌入向量均通过各自的MLP模块进行投影操作;
通过多模态交互模块将投影后的四层补丁级嵌入向量和四层去噪补丁级嵌入向量分别与文本提示嵌入向量进行交互和对齐;
分别计算交互对齐后的四层补丁级嵌入向量、四层去噪补丁级嵌入向量以及全局图像嵌入向量与文本提示嵌入向量的余弦相似度,生成异常图,将得到的异常图与真实异常图进行损失计算,通过损失反向传播进而训练工业图像异常检测模型的检测能力。
2.根据权利要求1所述的一种噪声抑制模态融合对齐的工业图像异常检测方法,其特征在于,文本编码器由12层噪声抑制注意力层组成。
3.根据权利要求2所述的一种噪声抑制模态融合对齐的工业图像异常检测方法,其特征在于,在噪声抑制注意力层中,将输入项乘以权重矩阵 ,生成的查询矩阵和键矩阵 ,将生成的矩阵都分为两个部分,记为 ,N表示序列长度;
计算第一注意力权重矩阵 和第二注意力权重矩阵,其中scale为缩放系数, 为激活函数;
通过第一注意力权重矩阵与第二注意力权重矩阵进行差值运算,生成去噪注意力输出,表示为:,
式中, 为可学习的权重系数, 为超参数, 为文本模板乘以权重矩阵生成的值矩阵。
4.根据权利要求3所述的一种噪声抑制模态融合对齐的工业图像异常检测方法,其特征在于,将训练集中的待检测图像调整为固定分辨率后输入至双通道图像编码器中的步骤包括:将待检测图像输入至第一通道CLIP图像编码器,在第1层至第5层通过QKV注意力机制提取图像特征,第6层至第24层通过VV注意力机制提取图像特征,输出全局图像嵌入向量和第6、12、18、24层的补丁级嵌入向量 ,其中i=1,2,3,4分别对应第[6,12,18,24]层;
将待检测图像输入至第二通道CLIP图像编码器,通过噪声抑制注意力层,输出第6、12、
18、24层的去噪补丁级嵌入向量 。
5.根据权利要求4所述的一种噪声抑制模态融合对齐的工业图像异常检测方法,其特征在于,将四层补丁级嵌入向量和四层去噪补丁级嵌入向量均通过各自的MLP模块进行投影操作的步骤包括:将补丁级嵌入向量 和去噪补丁集嵌入向量
分别送入各自的多层感知机进行映射操作,对齐嵌入向量,得到映射后的补丁级嵌入向量分别记为 ;
其中多层感知机包括一个输入层、一个中间层和一个输出层。
6.根据权利要求5所述的一种噪声抑制模态融合对齐的工业图像异常检测方法,其特征在于,通过多模态交互模块将投影后的四层补丁级嵌入向量和四层去噪补丁级嵌入向量分别与文本提示嵌入向量进行交互和对齐的步骤包括:将文本提示嵌入向量 通过一个可学习的权重矩阵 投影到Key空间,得到矩阵,再将文本提示嵌入向量 通过一个可学习的权重矩阵 投影到Value空间,得到矩阵 ;
将初步对齐的补丁级嵌入向量 分别通过各自可学习的权重矩阵投影到Query空间,得到 ;
分别计算注意力权重,公式为:
, ,其中 ;
将注意力权重 进行缩放并且归一化,公式为:,其中, , 是 的维度;
将注意力权重 与矩阵V相乘,并通过线性投射层,得到混合后的四层补丁级嵌入向量,公式为:,
,
,
,
将补 丁级嵌 入向 量 与混 合后 的补 丁级嵌 入向 量对应元素相加并归一化,得到最终对齐的补丁级嵌入向量。
7.根据权利要求6所述的一种噪声抑制模态融合对齐的工业图像异常检测方法,其特征在于,分别计算交互对齐后的四层补丁级嵌入向量、四层去噪补丁级嵌入向量以及全局图像嵌入向量与文本提示嵌入向量的余弦相似度,生成异常图的步骤包括:将补丁级嵌入向量 分别与文本提示嵌入向量 进行余弦相似度的计算,计算公式为:
,
其中, 代表每层的补丁数量,在每一层,图像被分割成1370个补丁,每个补丁都被转换成一个嵌入向量;
经过计算四层补丁级嵌入向量与文本提示嵌入向量后得到的相似度矩阵为:;
第一个补丁是记录全局图像信息,在计算局部时忽略第一个补丁的相似度,利用1369个补丁的相似度进行上采样,得到的相似图为:,
其中, , 代表去掉第一个补丁的相似度矩阵, 表示上采样;
将去噪补丁级嵌入向量 与文本提示嵌入向量进行相似度的计算并上采样,得到的相似图记为 ;
将全局图像嵌入向量 与文本提示嵌入向量 进行余弦相似度的计算,得到全局图像与文本提示的相似度矩阵为 ,计算公式为:,
对相似图 和 中每个像素点运用softmax函数,转化为正常和异常的概率分布,选择概率最高的类别作为预测标签,得到八张异常掩码图,记为 ,对八张异常掩码图进行加权融合,生成最终异常图。
8.根据权利要求1至7任一项所述的一种噪声抑制模态融合对齐的工业图像异常检测方法,其特征在于,工业图像异常检测模型的损失包括像素级损失 和图像级损失,公式为:。
9.根据权利要求1至7任一项所述的一种噪声抑制模态融合对齐的工业图像异常检测方法,其特征在于,正常文本提示模板为[a][photo][of][good][v1][v2][cls],异常文本提示模板为[a][photo][of][damage][v3][v4][cls][located][at][the][position],其中[cls]为此类物品的名称,[v1]、[v2]、[v3]、[v4]代表可学习的文本提示词,异常提示引入位置信息,[position]代表位置提示词,设置为[top]、[center]、[left]、[right]或[bottom]。