利索能及
我要发布
收藏
专利号: 2021104294235
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于无归一化深度残差与注意力机制的肠道病灶辅助诊断方法,其特征在于,所述方法包括以下步骤:

步骤1:输入图像数据集X={x1,x2,...,xn},其中,X矩阵表示数据集,n表示总样本数

224×224×3

量,xi∈R 表示输入图像三个通道像素值构成的特征向量,xi表示样本i,yi表示样本类别标签,其值为0表示正常,其值为1表示息肉,其值为2表示溃疡,当训练出一个分类模型后,以图像的特征向量xi为输入,预测输出的结果标签是0,1还是2,从而可以判断图片中是否正常、有息肉或者有溃疡;

步骤2:采用无归一化的ResNet基线模型的前四层作为特征提取器,从输入图像提取特征,输出特征图,特征提取器的后三层由多个引入Scaled Weight Standardization的残差块串联而成;

利用的主干网络在初始化的时候抑制残差分支,并使用Scaled Weight Standardization来消除均值偏移现象,确保残差分支保持方差,消除Batch维度内训练样本之间的相关性,这确保了网络具有ReLU激活函数的同时每通道激活函数不会随网络深度的增长而丢失信号,使网络训练和推理阶段偏差较小;Scaled Weight Standardization与中心权重标准化密切相关,其重新参数化卷积层,如下:其中的均值μ和方差σ是通过卷积滤波器的扇入范围计算的,用高斯权值初始化底层参数W,而γ是一个固定常数,在整个训练过程中,将这种约束作为网络前向传播中的可微操作;

步骤3:注意力分支结构和作用以及注意力图的生成过程如下:

3.1由于肠道图像中病灶边缘与正常组织壁边界模糊,构建一个注意力分支来聚焦病灶区域,其卷积层Convolution Layers是用残差块来构建的,残差块的第一个3×3卷积层的步幅设置为1,以保持特征图的分辨率;为了可以在前向传播过程中可视化注意力图,通过引入基于响应的视觉解释模型来应用注意力,构建一个注意力分支结构,生成注意力图,注意力图中的高亮位置就是聚焦病灶区域的位置,通过引入此注意力分支,网络在聚焦于图像重要位置的同时被训练,并提高了其分类性能;

3.2为了生成注意力图,注意力分支基于类激活映射CAM构建顶层,该顶层由卷积层和全局平均池化GAP组成,CAM是一个代表性的基于响应的视觉解释,可以使用卷积层的响应获得每个类别的注意力图,然而,CAM在训练过程中不能生成注意力图,因为注意力图是在训练后通过将K×H×W特征图的加权和与最后一个全连接层的权重相乘生成的;提出利用一个K×1×1卷积层来代替全连接层,经过K×1×1卷积层后,再利用GAP和Softmax函数输出类概率分数Prob.score,同时,注意力分支用K×H×W特征图生成注意力图,为了聚集K个特征图,将这些特征图用1×1×1卷积层卷积,生成1×H×W特征图,再用Sigmoid函数对1×H×W特征图进行归一化,生成注意力图;

步骤4:注意力机制将注意力图应用于特征提取器输出的K个特征图,并输出K个特征图g'(xi),g(xi)是特征提取器输出的特征图,M(xi)是注意力分支输出的注意力图,g'(xi)是注意力机制输出的特征图,输入到感知分支;注意力机制在特定通道C上将注意力图M(xi)和特征图g(xi)作点积,再将点积结果与特征图g(xi)求和,得到g'(xi),这可以在注意力图的峰值处突出显示特征图,同时防止注意力图的较低值区域降为零,g'(xi)表示为式(2),感知分支接收从注意力机制输出的特征图g'(xi),输入到分类器Classifier的卷积层,再利用Softmax激活函数输出最终类概率分数Prob.score;

g'(xi)=(1+M(xi))·g(xi)                    (2)

步骤5:使用注意力分支和感知分支两个分支的损失之和L(xi),作为训练损失,通过Softmax函数和交叉熵的结合来计算每个分支的训练损失,用Latt(xi)表示输入样本为xi时的注意力分支损失,Lper(xi)表示感知分支损失,总损失函数L(xi)表示为式(3),训练时,将

224×224的肠道图像输入到特征提取器,使用Adam优化器优化参数,StepLR机制调整学习率,结合损失函数对网络进行端到端的训练,得到最优的模型,再输入测试集图像对最优模型进行检验,使用准确率Accuracy,敏感度Sensitivity,特异度Specificity三个指标来评估最优模型的性能,三个指标分别表示为式(4),式(5),式(6);

L(xi)=Latt(xi)+Lper(xi)                       (3)

其中,TP、TN、FP、FN分别表示真阳性、真阴性、假阳性、假阴性的数量。