利索能及
我要发布
收藏
专利号: 2024109670708
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-25
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.基于半监督深度非平行支持向量机的智能医疗诊断方法,包括如下步骤:步骤一:构建和预处理医学数据集;包括数据筛选与预处理、数据归一化和数据标注,不均衡数据均衡化;

步骤二:增广有监督样本和无监督样本,通过构建掩码生成器和特征生成器,整合增广输出,从而提高模型的训练效果和泛化能力;基于自监督学习,通过对原始样本特征 ,进行一系列增强变换,生成新的训练样本,学习样本之间潜在关系;

步骤三:计算重构损失和一致性损失,包括构建特征表示网络模型、计算特征相应的logits、计算重构特征表示、计算样本的重构损失和计算掩码重构损失;重构损失衡量模型重构特征与原始特征之间的差异,而一致性损失确保神经网络的输出在不同条件下保持一致;

步骤四:使用置信度筛选高质量伪标签包括对无监督样本生成伪标签向量,并筛选出高质量的伪标签;

步骤五:构建分类任务损失函数,包括构建非平行类内损失函数和构建非平行类间损失函数;通过结合类内和类间的局部信息并采用参数共享机制,为每个类别寻找一个最优超平面 ;

步骤六:构建模型总体损失函数,包括促进类内样本紧凑性,类间样本区分度,模型重构精度和预测一致性;将这些目标损失函数融合到一个统一的损失函数;

步骤七:医疗诊断分级评估,实现对脑胶质瘤数据的分级诊断;对于一个新样本,即脑胶质瘤样本特征 ,通过计算 到每个非平行近端超平面的距离来判断新样本的类别;每一个非近端超平面就代表一种类别,其中,类别包括低级别胶质瘤LGG、多形性胶质母细胞瘤GBM;距离最近的超平面的类别就是新样本的类别。

2.如权利要求1所述的基于半监督深度非平行支持向量机的智能医疗诊断方法,其特征在于,步骤一具体包括:(1.1) 数据筛选与预处理;首先,对临床医学样本进行筛选和分析,提取出最频繁突变的20个基因位和2个临床特征:性别、诊断年龄;为了确保数据的完整性和质量,对原始样本进行预处理,包括过滤缺失关键信息的实例,将诊断年龄从字符串格式转换为连续值,以及排除不相关的列,不相关的列包括病历号、初步诊断和项目;

(1.2) 数据归一化和数据标注;对数据样本进行归一化处理;归一化处理后,根据医生的诊断结果,对样本打标签,得到有监督样本 ,其中 为维度 的样本特征, 为样本对应标签, 为有监督样本规模;对于没有打标签的样本,则为无监督样本,其中 为无监督样本规模;

(1.3) 不均衡数据均衡化;对预处理后的脑胶质瘤数据集进行检查,针对数据集中类别不均衡的问题,通过对少数类样本进行随机采样,增加少数类样本的数量,使数据达到平衡状态;具体为:先计算每个类别的样本数量记作 ,再确定目标样本数量;最多样本的类别的样本数量是 ,则目标是将所有类别的样本数量增加到 ;然后计算需要增加的样本数量,对于每个少数类 ,需要增加的样本数量为:(1)

最后从少数类 的样本中随机选择 个样本,并将这些样本添加到数据集中。

3.如权利要求1所述的基于半监督深度非平行支持向量机的智能医疗诊断方法,其特征在于,步骤二具体包括:(2 .1)  构建掩码生成器;该生成器输出维度为 的二进制掩码记作,其中 是以概率 的伯努利分布中随机采样得到的,即:

(2)

(2.2) 构建特征生成器;该生成器将输入掩码 并计算对应减法操作 ,根据和样本特征逐元素相乘得到 ;将样本特征 逐列随机打乱得到 与掩码 逐元素相乘,记作 ;最终操作可以表示为:(3)

其中, 为特征生成器,为增广特征(enhancing features), 为逐元素相乘,为样本特征,为随机打乱的样本特征;式(3)解释为保留掩码 中数值为1的部分加上掩码数值为0部分的原始样本;

(2.3) 整合增广输出;根据式(3),对样本特征 分别取有监督样本特征 ,无监督样本特征 , 和掩码 ,得到相应有监督样本增广特征 和无监督样本增广特征 , 。

4.如权利要求3所述的基于半监督深度非平行支持向量机的智能医疗诊断方法,其特征在于,步骤三具体包括:(3.1) 构建特征表示网络模型 ;采用网络模型 来提取样本在非线性空间中的特征表示,具体来说,网络 由编码器 和解码器 构成,均采用3层全连接层结构;编码器负责将输入数据映射到一个紧凑的特征空间中,而解码器 则用于重构输入数据,具体形式如下:(4)

其中,为函数复合符号; 由编码器 和解码器 复合构成作为整体网络;

(3.2) 计算特征相应logits;将增广特征 , , 拼接输入编码器 ,得到相应的logits,记作 , , ;

(5)

其中, 和 为网络权重和偏置, 为向量拼接符号;通过拼接增广特征,将其输入编码器并输出相应的logits;

(3.3) 计算重构特征表示;将增广特征 , , 拼接输入编码器‑解码器模型,得到有监督样本重构特征 ,无监督样本重构特征 和掩码重构特征 :(6)

其中, 和 为网络权重和偏置;通过拼接增广特征并输入编码器‑解码器模型,输出对应的重构特征;

(3.4) 计算样本的重构损失;重构损失能够评估自编码器重构特征与原始样本特征之间的差异程度;

计算有监督样本均方误差损失:

(7)

其中, 为有监督样本规模,原始样本特征 和样本重构特征 ;当最小化该损失时能够减小 与 之间的差异;

计算无监督样本的重构损失:

(8)

其中, 为无监督样本规模,原始无监督样本特征 和重构无监督样本特征 ;以最小化该损失为目的,减小 与 之间的差异,从而确保重构特征与原始样本特征的一致性;

(3.5) 计算掩码重构损失;对原始掩码 和重构掩码 ,计算交叉熵损失:(9)

其中, 为掩码 的规模大小;通过计算交叉熵损失来评估原始掩码 和重构掩码 之间概率分布的差异;

(3.6) 计算无监督样本的一致性损失;计算无监督样本logits, 和 的一致性损失(consistency loss):(10)

其中, 为无监督样本规模;在相同样本的情况下经过增强后的预测结果, 和仍能保持一致,以此来评估模型在预测层面上对数据变化保持稳健性的能力。

5.如权利要求4所述的基于半监督深度非平行支持向量机的智能医疗诊断方法,其特征在于,步骤四具体包括:(4.1) 对无监督样本生成伪标签向量;根据式(5)描述, 为无监督样本只经过编码器得到的logits;对于 有:(11)

其中, 为每个类别输出,为类别; 表示每个类别输出的向量;

将式(11)得到的 取绝对值,得到 ; 通过激活函数softmin得到映射为0‑1之间的实数,记作 ,并且归一化保证和为1,即:(12)

其中, 为激活函数softmin的符号表示;所有概率之和为1;

(4.2) 筛选高质量伪标签;引入标量超参数置信度阈值 ,预测结果在该阈值之上则保留该类别伪标签;先取 中最大类别概率与置信度阈值 对比,大于该阈值则保留;

(13)

其中,为指示函数, 为无监督样本最大类别概率,当最大类别概率大于置信度阈值 则 ,反之为0;

根据式(13),若大于置信度阈值 ,则取出伪标签记作 :(14)

其中,伪标签 为 中最大概率的类别的伪标签。

6.如权利要求5所述的基于半监督深度非平行支持向量机的智能医疗诊断方法,其特征在于,步骤五具体包括:最优超平面 形式如下:

(15)

其中, 是类别 的近端超平面; 和 是对应超平面的权重和偏置, 是编码器, 是样本特征;对于 类分类,构造 个二分类的分类器,第 个分类器中第 类为正类,其余类都作为负类进行训练;计算类内、类间损失流程如下:(5.1) 构建非平行类内损失函数;对于所有样本点 的第 类构建类内损失函数;要求第 类的输出为最小;以一个样本点 为例,根据真实标签 与伪标签 ,先筛选出第 类的输出,记作:(16)

再计算第 类的最小距离,损失函数构建如下:

(17)

对第 类做2‑范数,求第 类到原点的距离;

除此之外,还要求除第 类之外的类的最小输出 与第 类所属超平面距离至少为 ,对于一个样本点 ,损失函数构建如下:(18)

(19)

其中, 为边距;式(18)求得除第 类之外的类的最小输出,式(19)要求除第 类之外的类和第 类所属超平面有一个边距的距离;

(5.2) 构建非平行类间损失函数;对于所有样本点 的第 类与除第 类之外的类 构建类间损失函数;要求除第 类之外的类的最小输出 与第 类的距离至少为 ,对于一个样本点 ,损失函数构建如下:(20)

其中, 为边距,式(20)要求除第 类之外的类和第 类有一个边距的距离。

7.如权利要求6所述的基于半监督深度非平行支持向量机的智能医疗诊断方法,其特征在于,步骤六具体包括:(6.1) 融合类内和类间损失函数;通过结合式(17),式(19)和式(20)进行融合:(21)

其中, , 为正则项, , , 为权衡参数;;

对所有有监督样本做损失,有监督损失函数为:

(22)

无监督损失为:

(23)

式(23)中,为指示函数, 为无监督样本最大类别概率,当最大类别概率大于置信度阈值 ,则 ,反之为0;

(6.2) 构建统一的模型总体损失函数;根据以上损失(22),(23)与重构损失(7),(8),(9)与一致性损失(10),整合出总体损失函数;

(24)

其中, , , 为权衡参数。

8.如权利要求7所述的基于半监督深度非平行支持向量机的智能医疗诊断方法,其特征在于,步骤七中实现对脑胶质瘤数据的分级诊断,决策函数如下:(25)

其中, 表示绝对值, 表示第 个类别。

9.如权利要求8所述的基于半监督深度非平行支持向量机的智能医疗诊断方法,其特征在于:步骤一所述的数据是来源于癌症基因组图谱TCGA项目的低级胶质瘤LGG和胶质母细胞瘤GBM脑胶质瘤子项目;

步骤四所述的置信度阈值取0.95;

步骤六所述的权衡参数 , , 的值取1。

10.基于半监督深度非平行支持向量机的智能医疗诊断装置,其特征在于:包括存储器和一个或多个处理器,所述存储器中存储有可执行代码,所述一个或多个处理器执行所述可执行代码时,用于实现权利要求1‑9中任一项所述的基于半监督深度非平行支持向量机的智能医疗诊断方法。