利索能及
我要发布
收藏
专利号: 2024104623772
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于CNN‑Transformer并行编码器的医学图像分割方法,其特征在于,使用卷积神经网络捕捉到局部信息,Transformer捕捉到远程全局信息;通过特征筛选,调整注意力的分布和去除无用信息;通过双层融合模块融合多尺度特征并输出,具体步骤为:步骤1,获取医学图像分割训练数据集,并对其进行预处理操作;

步骤2,建立由卷积神经网络与金字塔Transformer组合而成的类U‑Net图像分割网络模型;

步骤3,由卷积神经网络和Transformer组成的并行编码器进行特征提取,并取每一层的特征进行注意力筛选;

步骤4,将提取后的特征输入到解码器,依次进行上采样和特征融合;

步骤5,将解码器执行完成后的结果使用卷积将通道数调整为1,并使用上采样还原图像到原始大小,最终输出分割图;

步骤2中,类U‑Net图像分割网络模型由编码器和解码器两个部分组成,两者通过带注意力机制的跳跃连接结合;编码器,使用的是ResNet34和Transformer两条路径并行的编码策略;编码器跳跃连接部分使用CBAM和EMA注意力机制;解码器,使用双层融合模块进行特征融合和最终输出;

编码器共有两个分支,包括以ResNet34为基本骨干的卷积神经网络分支和金字塔Transformer分支;

对于卷积神经网络分支共有四个层次,其中第一层、第二层和第三层分别为多个残差块,对应的特征维度分别为128×56×56、256×28×28、512×14×14;第四层由两个卷积层构成,每个卷积层包括卷积、BN层和ReLU激活函数,卷积核大小均为3×3,步长均为2,最终的输出维度为1024×7×7;

对于金字塔Transformer分支,同样也分为四个层次;第一层采用一个patch大小为4的patch embedding层来对大小为3×224×224的输入图像进行操作;然后通过Transformer层处理得到的分辨率大小为320×56×56的特征图,以捕获其全局信息;第二、第三和第四层的结构相同,为了保存patch embedding中的详细信息,将patch大小减少到2,使用金字塔结构的Transformer编码器,依次对特征图进行8、16和32倍的下采样;

将编码器的第一层特征送入通道‑空间注意力机制CBAM中进行特征提取;

将编码器的第二层、第三层和第四层的特征送入高效多尺度注意力机制EMA中进行特征提取,第二层、第三层和第四层的特征经过EMA处理后,维度保持不变;

高效多尺度注意力机制EMA,使用一个多尺度并行子网络来建立长短依赖关系, 为输出特征,具体操作如下:

1×1 3×3

其中σ表示sigmoid激活函数,f 示卷积核大小为1×1的卷积操作,f 示卷积核大小为3×3的卷积操作,AvgPoolX表示在X轴方向上的全局平均池化,AvgPoolY表示在Y轴方向上的全局平均池化,Matmul表示矩阵乘法,AP表示全局平均池化操作。

2.根据权利要求1所述的方法,其特征在于,步骤1具体包括如下步骤:步骤1.1,使用ISIC2018、BUSI和Kvasir‑SEG作为数据集;对于每个数据集,样本按照8:

2随机划分为不相交的训练/测试集,取训练集的20%样本作为验证集;

步骤1.2,将数据集中的图像尺寸调整为224×224,对其进行数据增强操作,所述的数据增强操作方法为:对数据集图像进行90°旋转和水平翻转,执行数据增强的概率为0.5。

3.根据权利要求2所述的方法,其特征在于,通道‑空间注意力机制CBAM,包括两个部分,一是通道的注意力,二是空间的注意力;

CBAM可以用以下公式表示:

其中,F是特征图,Mc和Ms分别表示基于通道的和基于空间的注意力, 表示逐元素相乘,F′和F″分别表示进行了通道注意力和空间注意力后的输出特征图;

通道注意力机制Mc的具体操作如下:

其中σ表示sigmoid激活函数,W0和W1分别表示两个卷积操作, 和 分别表示平均池化和最大池化;

空间注意力机制Ms的具体操作如下:

7×7

其中f 表示卷积核大小为7×7的卷积操作;

第一层的特征X1经过CBAM处理后的特征为H1,大小为448×56×56。

4.根据权利要求3所述的方法,其特征在于,步骤4包括两个部分,一个部分为第二、第三和第四层特征的上采样融合,另一个部分为第一层和其他三个层次的特征融合;

步骤4.1,将第四层的特征映射X4上采样到与X3相同的大小,然后将上采样后X4分别通过两个卷积操作得到 和 然后,将 和X3相乘,并将结果与 拼接起来;最后,使用卷积操作对得到的特征进一步处理,得到融合的特征图X34,大小为128×14×14,该过程可概括为以下公式:X34=f(Concat(f(X4)⊙X3,f(X4))) (5)其中⊙表示矩阵乘积,Concat(·)表示通道维度上的拼接操作,f(·)表示卷积操作;

步骤4.2,将X4,X3和X34上采样到与X2相同的大小,并分别使用卷积操作对得到的特征进一步处理;然后将处理后的X4和X3与X2相乘,并将结果与处理后的X34拼接起来;最后,将特征图送入两个卷积层中进行降维,得到特征图H2,大小为64×28×28,该过程可概括为以下公式:H2=f(f(Concat(f(X4)⊙f(X3)⊙X2,f(X34))))      (6)步骤4.3,将H2和步骤3中的H1送入融合输出模块,首先将H1通过卷积和下采样调整到和H2相同的大小;之后分别对H1和H2进行卷积操作将维度变为C/2×H×W,即32×28×28;为了计算相似矩阵,将特征从三维重构为二维,得到矩阵Q和K,大小为32×784;接着计算矩阵Q和矩阵K的相似度,并通过softmax归一化之后得到注意力特征图W;以上操作用公式表示为:W=softmax() (7)其中,fRS表示将一个张量重塑为一个向量,<,>表示点积,conv(·)表示卷积操作,softmax(·)表示softmax操作;

矩阵V由H1和H2叠加得到,维数为2C×H×W;在其后面连接一个卷积层,降低通道维数到

32×28×28;同样为了和注意力特征图W的维度匹配对其进行降维,矩阵V的大小为32×

784;矩阵V乘以转置的注意力特征图W得到加权后的特征;由于之后还有后续的卷积层和输出,所以增强的特征需要从二维重塑为三维;最后,将注意力特征图添加到原始特征图中;

整个过程可以用下面的等式来描述:

其中S为原始特征图,F为最终输出, 为逐元素相乘。

5.一种计算机可读存储介质,其上存储有计算机程序,其特征在于:该程序被处理器执行时实现如权利要求1~4中任一项所述的基于CNN‑Transformer并行编码器的医学图像分割方法中的步骤。

6.一种计算机设备,包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序,其特征在于,所述处理器执行所述程序时实现如权利要求1~4中任一项所述的基于CNN‑Transformer并行编码器的医学图像分割方法中的步骤。