利索能及
我要发布
收藏
专利号: 2021109816903
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种息肉影像语义分割方法,其特征在于:具体包括以下步骤:

步骤一、数据获取

将拍摄的肠镜视频转换为息肉图像,作为样本Image;制作样本Image对应的单通道标签Label;将样本Image与标签Label一一对应后,按比例划分为训练集和验证集;

步骤二、数据预处理

使用分步掩模法对训练集和验证集中的样本Image进行预处理:提取图像中的高亮区域,然后进行插值修复,将修复后的高亮区域与原图像中不反光的部分相或,得到去反光的样本Image;

步骤三、网络构建

构建包括编码器、中间层、解码器的Ext‑HarDNet网络;编码器基于HarDNet主干网络,提取输入数据的浅层特征和不同尺寸的深层特征,并将浅层特征丢弃、深层特征输入到中间层;中间层引入注意力机制,对不同尺寸的深层特征分别进行注意力特征图提取;解码器通过PPM和深层聚合上采样,对中间层提取的多张注意力特征图进行融合,将融合后的一张特征图进行双线性采样,输出分割结果;

所述编码器用于提取得到不同尺寸的浅层特征和深层特征;编码器的结构依次为卷积层、最大池化层、HardBlock×8结构块、最大池化层、HardBlock×16结构块、HardBlock×16结构块、最大池化层、HardBlock×16结构块、最大池化层和HardBlock×4结构块;其中HardBlock×h结构块为HarDNet网络的主干部分,h为结构块中节点的个数;编码器对于p pHardBlock×h结构块中的第l个节点,如果l能整除2,则第l个节点与第l‑2个节点相连,其p h中0

使用编码器提取不同尺寸的浅层特征和深层特征的方法为:

s3.1.1、将步骤二得到的去反光的样本Image依次进行步长为2、卷积核为3×3的卷积,步长为1、卷积核为3×3的卷积和步长为2的最大池化,得到初步下采样的特征图;

s3.1.2、将初步下采样的特征图输入到HardBlock×8结构块后再进行步长为2的最大池化,得到通道数为128、尺寸为88×88的浅层特征图f1;

s3.1.3、将浅层特征图f1输入到HardBlock×16结构块进一步压缩,得到通道数为256、尺寸为88×88的浅层特征图f2;

s3.1.4、将浅层特征图f2输入到HardBlock×16结构块后再进行步长为2的最大池化,得到通道数为320、尺寸为44×44的深层特征图f3;

s3.1.5、将深层特征图f3输入到HardBlock×16结构块后再进行步长为2的最大池化,得到通道数为640、尺寸为22×22的深层特征图f4;

s3.1.6、将深层特征图f4输入到HardBlock×4结构块进一步压缩,得到通道数为1024、尺寸为11×11的深层特征图f5;

使用中间层得到注意力特征图的方法为:

s3.2.1、将得到的深层特征图f3、f4、f5分别线性映射为Query矩阵Q3,Q4,Q5;

s3.2.2、随机初始化外部记忆矩阵Mkn∈Sn×d,n=3、4、5;其中Sn是外部记忆矩阵Mkn的像素个数,d是特征维度;通过矩阵相乘计算Query矩阵Qn与对应的外部记忆矩阵Mkn的相似性An,然后对相似性An进行Softmax归一化,用于表示深层特征中第i个像素与外部记忆矩阵中第j个像素之间的关系:s3.2.3、将s3.2.2中归一化后的相似性An与外部记忆矩阵Mkn的权重Mvn进行矩阵相乘,得到深层特征fn对应的注意力特征图Foutn:Foutn=AnMvn

其中注意力特征图Fout3、Fout4、Fout5的尺寸大小分别为:44×44、22×22、11×11,通道数分别为320、640和1024;

步骤四、网络训练优化

将经过步骤二预处理的训练集数据输入到步骤三构建的Ext‑HarDNet网络中进行语义分割,网络通过训练集的样本Image和对应的标签Label训练网络模型参数,训练1个batch后,将预处理后验证集的样本Image输入到Ext‑HarDNet网络中进行语义分割,将输出结果与对应的验证集标签Label进行计算,得到模型分割结果的指标,根据指标修改网络参数完善网络,从而完成模型的训练优化;

步骤五、息肉图像分割

将待检测的肠镜视频转换为息肉图像,经过步骤二预处理后输入步骤四优化后的网络进行语义分割,得到分割后的息肉轮廓图像。

2.如权利要求1所述一种息肉影像语义分割方法,其特征在于:训练集和验证集的数据比例为4∶1。

3.如权利要求1所述一种息肉影像语义分割方法,其特征在于:所述分步掩模法具体包括以下步骤:s2.1、设置阈值为200,对RGB三通道的Image图像进行二值化处理,提取高亮区域;再设置阈值为255,将RGB三通道的Image图像转化为单通道的灰度图像,得到掩模Mask;

s2.2、使用s2.1得到的掩模Mask对RGB三通道的Image图像进行步长为10的流体力学插值处理,得到插值修复图;

s2.3、对s2.2得到的插值修复图进行滤波核为25的大核中值滤波,并将滤波后的图像与掩模Mask相与,得到修复后的高亮区域;

s2.4、将s2.2得到的插值修复图与掩模Mask进行反相与,得到原图像中不反光的部分;

s2.5、将s2.3、s2.4得到的修复后的高亮区域、原图像中不反光的部分相或,然后进行滤波核为3的小核中值滤波,得到去反光的样本Image。

4.如权利要求1所述一种息肉影像语义分割方法,其特征在于:HardBlock×h结构块中,节点通道数的压缩因子m=1.7。

5.如权利要求1所述一种息肉影像语义分割方法,其特征在于:

s3.3.1、将步骤三中得到的注意力特征图Fout3输入到PPM3中进行目标尺寸大小为1×1,

2×2,3×3,6×6的自适应平均池化,然后再通过大小为1×1深度卷积,得到尺寸不变,通道数降为80的特征图;

s3.3.2、将4个不同尺寸的特征图同时利用双线性差值进行上采样,还原至大小为44×

44,并与注意力特征图Fout3进行拼接,得到尺寸为44×44,通道数为640的特征图,再通过大小为1×1深度卷积,得到尺寸不变,通道数降为44的特征图Pout3;

s3.3.3、分别对注意力特征图Fout4和Fout5进行s3.3.1、s3.3.2的操作,在对注意力特征图Fout4和Fout5进行双线性差值上采样时,目标尺寸分别为22×22,11×11;1×1深度卷积的目标通道数不变,得到通道数为44,尺寸分别为22×22,11×11的特征图Pout4、Pout5;

s3.3.4、分别对特征图Pout4、Pout5进行尺度为2、4的上采样后,与Pout3相乘,得到特征图Node‑f3‑1;对特征图Pout5进行尺度为2的上采样后,与Pout4相乘,得到特征图Node‑f4‑1;

s3.3.5、将特征图Pout3作为特征图Node‑f5‑1,进行尺度为2的上采样后,与特征图Node‑f4‑1相乘,得到特征图Node‑f4‑2;

s3.3.6、将特征图Node‑f4‑2进行尺度为2的上采样后,与特征图Node‑f3‑1相乘,得到特征图Node‑f3‑2,对特征图Node‑f3‑2进行双线性采样,输出分割结果。

6.如权利要求1所述一种息肉影像语义分割方法,其特征在于:网络训练优化过程中使用的指标包括mDice、mIoU、wfm、MAE、maxEm和FPS。

7.一种息肉影像语义分割装置,其特征在于:包括数据采集模块、语义分割模块和显示模块;其中数据采集模块用于采集肠镜视频并转换为息肉图像后传输到语义分割模块;语义分割模块用于完成息肉图像的分割并将分割结果传输给显示模块;显示模块用于显示分割结果;

该装置的使用方法包括以下步骤:

步骤一、数据获取

将拍摄的肠镜视频转换为息肉图像,作为样本Image;制作样本Image对应的单通道标签Label;将样本Image与标签Label一一对应后,按比例划分为训练集和验证集;

步骤二、数据预处理

使用分步掩模法对训练集和验证集中的样本Image进行预处理:提取图像中的高亮区域,然后进行插值修复,将修复后的高亮区域与原图像中不反光的部分相或,得到去反光的样本Image;

步骤三、网络构建

构建包括编码器、中间层、解码器的Ext‑HarDNet网络;编码器基于HarDNet主干网络,提取输入数据的浅层特征和不同尺寸的深层特征,并将浅层特征丢弃、深层特征输入到中间层;中间层引入注意力机制,对不同尺寸的深层特征分别进行注意力特征图提取;解码器通过PPM和深层聚合上采样,对中间层提取的多张注意力特征图进行融合,将融合后的一张特征图进行双线性采样,输出分割结果;

使用编码器提取不同尺寸的浅层特征和深层特征的方法为:

s3.1.1、将步骤二得到的去反光的样本Image依次进行步长为2、卷积核为3×3的卷积,步长为1、卷积核为3×3的卷积和步长为2的最大池化,得到初步下采样的特征图;

s3.1.2、将初步下采样的特征图输入到HardBlock×8结构块后再进行步长为2的最大池化,得到通道数为128、尺寸为88×88的浅层特征图f1;

s3.1.3、将浅层特征图f1输入到HardBlock×16结构块进一步压缩,得到通道数为256、尺寸为88×88的浅层特征图f2;

s3.1.4、将浅层特征图f2输入到HardBlock×16结构块后再进行步长为2的最大池化,得到通道数为320、尺寸为44×44的深层特征图f3;

s3.1.5、将深层特征图f3输入到HardBlock×16结构块后再进行步长为2的最大池化,得到通道数为640、尺寸为22×22的深层特征图f4;

s3.1.6、将深层特征图f4输入到HardBlock×4结构块进一步压缩,得到通道数为1024、尺寸为11×11的深层特征图f5;

使用中间层得到注意力特征图的方法为:

s3.2.1、将得到的深层特征图f3、f4、f5分别线性映射为Query矩阵Q3,Q4,Q5;

s3.2.2、随机初始化外部记忆矩阵Mkn∈Sn×d,n=3、4、5;其中Sn是外部记忆矩阵Mkn的像素个数,d是特征维度;通过矩阵相乘计算Query矩阵Qn与对应的外部记忆矩阵Mkn的相似性An,然后对相似性An进行Softmax归一化,用于表示深层特征中第i个像素与外部记忆矩阵中第j个像素之间的关系:s3.2.3、将s3.2.2中归一化后的相似性An与外部记忆矩阵Mkn的权重Mvn进行矩阵相乘,得到深层特征fn对应的注意力特征图Foutn:Foutn=AnMvn

其中注意力特征图Fout3、Fout4、Fout5的尺寸大小分别为:44×44、22×22、11×11,通道数分别为320、640和1024;

步骤四、网络训练优化

将经过步骤二预处理的训练集数据输入到步骤三构建的Ext‑HarDNet网络中进行语义分割,网络通过训练集的样本Image和对应的标签Label训练网络模型参数,训练1个batch后,将预处理后验证集的样本Image输入到Ext‑HarDNet网络中进行语义分割,将输出结果与对应的验证集标签Label进行计算,得到模型分割结果的指标,根据指标修改网络参数完善网络,从而完成模型的训练优化;

步骤五、息肉图像分割

将待检测的肠镜视频转换为息肉图像,经过步骤二预处理后输入步骤四优化后的网络进行语义分割,得到分割后的息肉轮廓图像。