1.一种融合中文医疗领域特征的医疗实体识别方法,其特征在于,包括如下步骤:S1:对中文药品说明书进行文本预处理操作,包括对说明书文本进行预清洗和文本的切分处理;
S2:输入的句子通过中文语义分析工具得到语义依存关系,构造语义依存关系网络图,采用图卷积神经网络提取文本词级别的特征,其中输入图卷积神经网络的特征融合中文医疗领域字音、字形、字典的特征;
S3:采用预训练模型提取医疗文本字级别的特征。
S4:采用基于双向LSTM和CRF的实体识别模型,输入特征融合步骤S2中的文本词级别特征和步骤S3中的文本字级别特征,实现药品说明书中的实体识别的任务。
2.如权利要求1所述的一种融合中文医疗领域特征的医疗实体识别方法,其特征在于,所述步骤S1中,对文本的预处理操作包括文本的预清洗和文本的切分处理,对说明书文本中的无效字符进行过滤,针对说明书文本篇幅长的问题,采用两级文本切分的策略,根据文本之间特定的分隔符进行切分,切分后的句子过短则合并短句子,使得合并后的句子长度不超过设置的句子最大长度。
3.如权利要求1所述的一种融合中文医疗领域特征的医疗实体识别方法,其特征在于,所述步骤S2具体包括:S2.1:输入的句子通过中文语义分析工具得到语义依存关系,构造语义依存关系网络图 其中V表示的是句子中的词汇节点,E表示的是词汇之间的语义依存关系;
S2.2:基于步骤S2.1构造的语义依存关系网络图,构建邻接矩阵 采用以下公式对邻接矩阵 进行卷积操作,对于输入图卷积神经网络的节点特征,融合了中文医疗领域字音、字形、字典的特征,字音通过拼音的声母、韵母、声调进行编码,字形通过汉字的部首信息和其余部分进行编码,医疗实体部首大多包含“月”、“疒”等,相同的偏旁部首可能代表医疗实体中的一类实体,对部首进行单独的编码可以更好地识别实体,字典信息根据医疗领域词典,采用N‑gram语言模型描述医疗实体这类由字构成的词;
1)字音向量 具体为:
获取汉字的拼音,将拼音划分为声母、韵母、声调三个部分,通过拼音的声母、韵母、声调来编码汉字的拼音;
2)字形向量 具体为:
统计汉字的部首信息和获取汉字的笔画顺序信息,构建字典Dr和Ds,根据汉字的结构拆分成两个部分,通过两个部分对汉字的形状进行编码,如果有部分在部首字典Dr中,取该部sr首的one‑hot编码X ,其余的部分按照笔画进行编码,任何一个汉字都可以由横、竖、撇、捺、ss折、点的线性组合表示,根据Ds,获取汉字剩余笔画的编码X ;
其中,concat(·)表示将括号中的向量进行拼接;
3)字典向量 具体为:
根据N‑gram特征模板和医疗领域词典,获取字典向量。
4.如权利要求3所述的一种融合中文医疗领域特征的医疗实体识别方法,其特征在于,步骤S2.2所述的输入图卷积神经网络的节点特征可表示为:聚合不同词汇之间的特征:
(l) (l)
其中, 表示第l层图卷积操作输出的词汇节点的特征表示,W ,b 表示网络学习的参数,σ(·)表示激活函数,D表示 对应的度矩阵,IN表示单位矩阵。
5.如权利要求1所述的一种融合中文医疗领域特征的医疗实体识别方法,其特征在于,所述步骤S2中,所述的语义依存关系网络图中的词汇之间的语义依存关系,包括当事关系、受事关系、客事关系等。
6.如权利要求1所述的一种融合中文医疗领域特征的医疗实体识别方法,其特征在于,所述步骤S3中,使用预训练模型BERT把输入的文本信息中的字嵌入成字向量
7.如权利要求1所述的一种融合中文医疗领域特征的医疗实体识别方法,其特征在于,所述步骤S4中,将步骤S2、S3中获得的文本词级别特征和文本字级别特征进行融合,具体公式如下:将融合后的特征向量 作为BiLSTM的输入,正向LSTM输出 与反向LSTM输出 依次拼接为 经过CRF模型得到标签序列的得分score,具体公式如下:
其中,P表示BiLSTM提取的语义特征矩阵,Pij表示把第i个汉字分类至第j个标签的分数,A表示转移概率矩阵,Aij表示标注序列从第i个标签转移到第j个标签的概率,y=(y1,y2,···,yn)为句子的标签序列;
所有可能的标签序列的概率可表示为:
用以下最大似然函数对模型进行训练直至模型收敛:
8.一种融合中文医疗领域特征的医疗实体识别系统,其特征在于:包括依次连接的数据收集处理模块、特征提取模块、序列标注识别模块;
所述数据收集处理模块,用于爬取药品相关数据,收集中文药品说明书,并对文本数据进行预处理操作,具体包括:文本的预清洗和文本的切分处理;
所述特征提取模块,用于提取并融合文本词级别的特征和字级别的特征,具体包括:数据收集处理模块输出的句子通过中文语义分析工具得到语义依存关系,构造语义依存关系网络图,节点的特征加入了字音字形和字典的特征,再通过图卷积神经网络图卷积神经网络获得词级别的特征,融合通过预训练模型BERT获得的字级别的特征;
所述序列标注识别模块,采用基于BiLSTM和CRF的实体识别模型,对文本的特征进行学习,进行序列标注,并组合标签,进而实现实体识别的任务。