利索能及
我要发布
收藏
专利号: 2022115824615
申请人: 重庆邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-04
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种医疗文本数据生成方法,其特征在于,包括以下步骤:

S1.获取医疗记录样本集合,采用MetaMap查找医疗记录样本集合中的重要短语,并在MetaMap中进行专业医学名称匹配;

S2.每一个医疗记录样本采用匹配得到的专业医学名称替换重要短语合成多个新文本,通过Siamese CNN‑BIGRU模型计算每个新文本与该医疗记录样本的相似度,采用相似度最大的新文本作为第一新医疗记录文本,最终得到与医疗记录样本集合对应的第一新医疗记录文本集合;

S3.对医疗记录样本集合进行预处理得到处理样本集合,通过WordNet字典查找处理样本集合中每个单词的多个同义词;

S4.结合概念语义相似度模型与路径相似计算模型构建改进的词汇相似度模型,通过改进的词汇相似度模型计算每个单词与其对应的多个同义词的相似度,采用最大相似度所属的同义词替换单词,生成第二新医疗记录文本集合;

采用改进的词汇相似度模型计算处理样本中每个单词与其对应的多个同义词的相似度,表示为:其中,simMICS()表示概念语义相似度模型,wo表示处理样本中的单词,wq表示wo的第q个同义词, 表示wq的第j个语义概念, 表示wo的第i个语义概念,表示增强系数;ω表示权重参 数, 表 示wo的 语义概 念集, 表示wq 的语义 概念集 ,表示两个语义概念集间的路径长度;

S5.将医疗记录样本集合、第一新医疗记录文本集合和第二新医疗记录文本集合用作训练样本,采用Word2vec将训练样本转换为词嵌入向量输入医疗文本分类模型进行训练,得到具有分类能力的医疗文本分类模型。

2.根据权利要求1所述的一种医疗文本数据生成方法,其特征在于,获取第一新医疗记录文本的过程包括:S11.获取医疗记录样本集D={D1,D2,...,Dn,...,DN},N表示医疗记录样本数量,将每一个医疗记录样本进行句子划分得到医疗文档,将医疗记录样本Dn所对应的医疗文档Sn表示为Sn={s1,s2,...,sm,...,sM},M表示医疗文档中的句子数量;

S12.将医疗文档Sn中的句子sm通过MetaMap传输到UMLS,在UMLS中查找句子sm中的重要短语及其短语概念;

S13.通过短语概念在UMLS中匹配其对应的多个专业医学名称,采用多个专业医学名称分别在句子sm中替换该短语概念所指的重要语句组成多个新句子,通过Siamese CNN‑BIGRU模型计算每个新句子与句子sm的相似度,在医疗记录样本Dn中采用相似度最大的新句子替换句子sm,医疗文档Sn中的所有句子处理完成后得到第一新医疗记录文本D′n。

3.根据权利要求2所述的一种医疗文本数据生成方法,其特征在于,Siamese CNN‑BIGRU模型包括卷积层、双向GRU层、池化层、全连接层和相似度计算层;采用Siamese CNN‑BIGRU模型计算相似度的过程包括:S131.对原始句子进行预处理得到标准原始句子,对该原始句子对应生成的新句子进行预处理得到第一预处理句子;

S132.采用词向量表分别对标准原始句子和第一预处理句子进行映射得到标准高维稠密向量和第一高维稠密向量;

S133.在卷积层对标准高维稠密向量和第一高维稠密向量分别进行卷积运算得到标准一维向量和第一一维向量;

S134.采用双向GRU层分别得到标准一维向量和第一一维向量的标准精炼特征和第一精炼特征;

S135.通过池化层对标准精炼特征和第一精炼特征分别进行降维处理后输入全连接层,得到标准语义信息和第一语义信息;

S136.将标准语义信息和第一语义信息送入相似度计算层,计算原始句子与该新句子的相似度,表示为:其中,v表示原始句子的标准语义信息,v′表示新句子的第一语义信息,d(v,v′)表示原始句子与新句子的相似度,vx表示标准语义信息在第x个维度的向量,v′x表示第一语义信息在第x个维度的向量。

4.根据权利要求1所述的一种医疗文本数据生成方法,其特征在于,对医疗记录样本集合进行预处理的过程包括:S21.使用jieba分词工具,将医疗记录样本划分成词汇列表;

S22.通过停用词表删除词汇列表中语义贡献小或没有语义贡献的词汇,得到新词汇列表;

S23.使用波特词干器对新词汇列表中的所有词汇进行词尾变化去除处理,若词汇为派生词则将其变回基本形,最终得到该医疗记录样本的处理样本。

5.一种采用如权利要求1‑4任意一项所述的一种医疗文本数据生成方法的医疗文本数据生成系统,其特征在于,包括数据获取模块、第一新医疗记录文本生成模块,数据预处理模块和第二新医疗记录文本生成模块,其中:数据获取模块,用于获取训练医疗文本分类模型所需的医疗记录样本集合;

第一新医疗记录文本生成模块,用于根据MetaMap和Siamese CNN‑BIGRU模型处理医疗记录样本集合,得到第一新医疗记录文本集合;

数据预处理模块,用于对医疗记录样本进行预处理,得到处理样本;

第二新医疗记录文本生成模块,用于通过WordNet字典和概念语义相似度模型对处理样本进行同义词替换,生成第二新医疗记录文本集合。

6.根据权利要求5所述的一种医疗文本数据生成系统,其特征在于,第一新医疗记录文本生成模块包括:匹配单元,用于采用MetaMap查找医疗记录样本集合中的重要短语,并在MetaMap中进行专业医学名称匹配;

合成单元,用于在每一个医疗记录样本中,采用匹配得到的多个专业医学名称替换对应的重要短语合成多个新文本;

文本相似度计算单元,用于通过Siamese CNN‑BIGRU模型计算每个新文本与其对应的原始医疗记录样本的相似度,采用相似度最大的新文本作为第一新医疗记录文本;

第二新医疗记录文本生成模块包括:

同义词查找单元,用于通过WordNet字典查找处理样本中每个单词的多个同义词;

单词相似度计算单元,用于通过改进的词汇相似度模型计算每个单词与其对应的多个同义词的相似度,采用最大相似度所属的同义词替换单词。