利索能及
我要发布
收藏
专利号: 2025110869079
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于文本背景感知增强的小样本工业缺陷图像分割方法,其特征在于:包括如下步骤:S1、根据工业缺陷图像集构建对应支持‑查询对 ,其中, 为查询图像,支持集, 为第 张支持图像, 为第 张支持图像的掩码标签, 为支持图像的数量;

S2、建立文本背景感知增强模型以执行如下操作:

S21、分别获取各支持图像的缺陷区域的前景文本和多个背景文本;

S22、将查询图像输入CLIP模型的图像编码器,对应提取多层次视觉特征和多层次注意力权重矩阵,并将所属类别的支持图像的前景文本和各背景文本输入CLIP模型的文本编码器,对应获得前景文本嵌入向量和各背景文本嵌入向量;

S23、根据查询图像的多层次视觉特征、前景文本嵌入向量和各背景文本嵌入向量,利用Grad‑CAM方法生成对应粗粒度激活图;

S24、根据粗粒度激活图、多层次视觉特征和多层次注意力权重矩阵,获取静态细化激活图和动态细化激活图;

S25、将查询图像、对应支持图像和掩码标签输入少样本分割模型,并将静态细化激活图和动态细化激活图作为注意力引导信号;

S3、利用全部支持‑查询对训练文本背景感知增强模型;

S4、将待分割的查询图像、对应支持图像和掩码标签输入训练好的文本背景感知增强模型,获得少样本分割模型的输出结果作为对应查询图像的分割预测结果。

2.如权利要求1所述的基于文本背景感知增强的小样本工业缺陷图像分割方法,其特征在于:所述查询图像即工业缺陷图像集中的工业缺陷图像,所述支持图像为预先标注缺陷类别的工业缺陷图像,所述支持图像的掩码标签为对应支持图像中全部像素点的二值图或多类标注图。

3.如权利要求1所述的基于文本背景感知增强的小样本工业缺陷图像分割方法,其特征在于:所述各支持图像的缺陷区域的前景文本和多个背景文本根据预设问答模板利用DeepSeek‑R1大语言模型生成;所述多层次视觉特征 ,为第 层视觉特征,所述多层次注意力权重矩阵 ,

为第 层注意力权重矩阵, , 为图像编码器的总层数, 为查询

图像的高度, 为查询图像的宽度。

4.如权利要求1所述的基于文本背景感知增强的小样本工业缺陷图像分割方法,其特征在于:所述利用Grad‑CAM方法生成对应粗粒度激活图,具体如下:S231、计算多层次视觉特征中第 层视觉特征的每个空间位置的视觉特征分别与前景文本嵌入向量和各背景文本嵌入向量的余弦相似度, 为图像编码器的总层数;

S232、将各余弦相似度经过softmax函数归一化对应形成概率向量;

S233、将概率向量与真实标签的交叉熵损失作为粗粒度激活图生成损失函数,真实标签的前景为1,背景为 0;

S234、计算粗粒度激活图生成损失函数对第 层视觉特征的第 个通道中空间位置的视觉特征的偏导数,作为对应通道中空间位置 的视觉特征的梯度,为查询图像的高度方向索引,为查询图像的宽度方向索引, , , 为查询图像的高度,为查询图像的宽度;

S235、将第 层视觉特征的每个通道的全部梯度分别进行全局平均池化,获得对应通道的全局梯度,并利用各通道的全局梯度对第 层视觉特征的对应通道的视觉特征进行加权求和,再经过ReLU激活函数生成粗粒度激活图。

5.如权利要求1所述的基于文本背景感知增强的小样本工业缺陷图像分割方法,其特征在于:所述根据粗粒度激活图、多层次视觉特征和多层次注意力权重矩阵,获取静态细化激活图和动态细化激活图,具体如下:S241、根据多层次视觉特征和多层次注意力权重矩阵基于联合细化策略获取静态细化矩阵和动态细化矩阵;

S242、将粗粒度激活图分别与静态细化矩阵和动态细化矩阵进行矩阵乘法操作,对应获得静态细化激活图和动态细化激活图。

6.如权利要求5所述的基于文本背景感知增强的小样本工业缺陷图像分割方法,其特征在于:所述根据粗粒度激活图、多层次视觉特征和多层次注意力权重矩阵,获取静态细化激活图和动态细化激活图后,还根据预设阈值由动态细化激活图生成伪标签,即当动态细化激活图中每个空间位置的激活值大于等于预设阈值时,认为是伪标签的前景区域,否则,认为是伪标签的背景区域;

所述联合细化策略包括静态细化策略和动态细化策略,其中:

所述静态细化策略执行如下操作:

将多层次注意力权重矩阵中各层注意力权重矩阵进行通道求平均后采用Sinkhorn算法获得归一化矩阵;

将归一化矩阵与归一化矩阵的转置进行矩阵乘法操作,获得高阶优化矩阵;

对高阶优化矩阵和归一化矩阵中每个空间位置取两者中大的值,生成静态细化矩阵;

所述动态细化策略执行如下操作:

将多层次视觉特征中全部层视觉特征在通道维度上拼接后进行卷积操作 获得中间层特征;

将中间层特征进行形状重塑操作形成重塑特征,再将重塑特征和重塑特征的转置进行矩阵乘法操作,形成初始动态细化矩阵;

分别计算多层次注意力权重矩阵中各层注意力权重矩阵与初始动态细化矩阵中对应元素的差值,并将对应层全部元素的差值相加形成对应层融合特征;

将各层融合特征进行通道求平均获得平均矩阵,并选取多层次注意力权重矩阵中高于平均矩阵的注意力权重矩阵作为中间层注意力矩阵;

将选取后的中间层注意力矩阵进行通道求平均,获得中间层优化矩阵;

将初始动态细化矩阵与中间层优化矩阵进行逐像素乘积,获得当前训练轮次的动态细化矩阵,并将当前训练轮次的动态细化矩阵与伪标签的交叉熵损失作为下一训练轮次的动态细化矩阵的损失函数。

7.如权利要求1所述的基于文本背景感知增强的小样本工业缺陷图像分割方法,其特征在于:所述少样本分割模型的分割损失为查询图像的分割预测结果与真实掩码标签的交叉熵损失。

8.如权利要求1所述的基于文本背景感知增强的小样本工业缺陷图像分割方法,其特征在于:所述少样本分割模型为PFENet模型或HDMNet模型。

9.一种基于文本背景感知增强的小样本工业缺陷图像分割系统,其特征在于:包括数据获取模块、模型搭建模块、模型训练模块和预测模块,其中:所述数据获取模块,用于根据工业缺陷图像集构建对应支持‑查询对 ,其中, 为查询图像,支持集 , 为第 张支持图像, 为第 张支持图像的掩码标签,为支持图像的数量;

所述模型搭建模块,用于建立文本背景感知增强模型以执行如下操作:分别获取各支持图像的缺陷区域的前景文本和多个背景文本;

将查询图像输入CLIP模型的图像编码器,对应提取多层次视觉特征和多层次注意力权重矩阵,并将所属类别的支持图像的前景文本和各背景文本输入CLIP模型的文本编码器,对应获得前景文本嵌入向量和各背景文本嵌入向量;

根据查询图像的多层次视觉特征、前景文本嵌入向量和各背景文本嵌入向量,利用Grad‑CAM方法生成对应粗粒度激活图;

根据粗粒度激活图、多层次视觉特征和多层次注意力权重矩阵,获取静态细化激活图和动态细化激活图;

将查询图像、对应支持图像和掩码标签输入少样本分割模型,并将静态细化激活图和动态细化激活图作为注意力引导信号;

所述模型训练模块,用于利用全部支持‑查询对训练文本背景感知增强模型;

所述预测模块,用于将待分割的查询图像、对应支持图像和掩码标签输入训练好的文本背景感知增强模型,获得少样本分割模型的输出结果作为对应查询图像的分割预测结果。

10.一种基于文本背景感知增强的小样本工业缺陷图像分割存储介质,用于存储计算机程序,其特征在于:所述计算机程序被处理器执行时实现如权利要求1至8任一所述的基于文本背景感知增强的小样本工业缺陷图像分割方法。