1.基于多层次自适应语义增强的中文医疗命名实体识别方法,其特征在于,包括如下步骤:(1)长度为n的中文文本表示为 ,构建字符 特征,包括字符特征、边界特征、部首特征、拼音特征;
(2)通过ERNIE‑Health预训练模型将字符级别 的特征转化为向量表示,包括字符特征向量 、边界特征向量 、部首特征向量 、拼音特征向量 ;
(3)将四种字符级特征输入字符层自适应语义增强模块;使用卷积层对字符特征进行压缩,通过门控机制和ReLU激活函数进行非线性转换,动态调整语义权重,使用多层感知机进行解压缩,得到增强后的字符级特征;
(4)将增强后的字符级特征输入句子层自适应语义增强模块,通过压缩和解压缩机制自适应学习句子中不同字符的贡献;具体包括:(4.1)使用卷积层进行压缩,将 每个字符的特征向量表示为特征矩阵:
经卷积压缩后,200维增强特征向量变为句子级的一维特征向量:(4.2)通过门控机制和ReLU激活函数进行非线性转换,动态调整语义权重;使用门控机制对特征进行选择:其中, 和 是门控机制的权重和偏置,是激活函数;
通过ReLU激活函数对门控后的特征进行非线性转换,获得低维重构语义权重矩阵,公式如下:(4.3)使用多层感知机(MLP)将低纬语义权重矩阵解压缩回高维空间,生成高维权重矩阵:(4.4)将原始字符级语义特征矩阵与解压缩后的权重矩阵进行 Hadamard 乘积操作,得到增强后的句子级语义特征:(5)将经过多层次自适应语义增强模块的增强特征输入BiLSTM‑CRF模块进行标签预测。
2.根据权利要求1所述的基于多层次自适应语义增强的中文医疗命名实体识别方法,其特征在于:所述步骤(2)具体如下:(2.1)对于字符特征、边界特征、部首特征、拼音特征,通过ERNIE‑Health预训练模型将其分别转化为50维的特征向量,每个字符的向量表示 由4个50维的字符级特征组成:其中, 表示字符特征向量, 表示边界特征向量, 表示部首特征向量, 表示拼音特征向量。
3.根据权利要求1所述的基于多层次自适应语义增强的中文医疗命名实体识别方法,其特征在于:步骤(3)将向量表示 输入字符层自适应语义增强模块中以动态调整语义权重包括:(3.1)使用卷积层进行压缩,将特征向量表示为特征矩阵:卷积操作公式如下:
其中,是输入特征矩阵,是卷积核大小, 是卷积核权重, 是偏置;
(3.2)通过门控机制和ReLU激活函数进行非线性转换,动态调整语义权重;使用门控机制对特征进行选择:其中, 和 是门控机制的权重和偏置,是sigmoid函数;
通过ReLU激活函数对门控后的特征进行非线性转换,获得低维重构语义权重矩阵,公式如下:(3.3)使用多层感知机(MLP)将低纬语义权重矩阵解压缩回高维空间,生成高维权重矩阵:(3.4)将原始字符级语义特征矩阵与解压缩后的权重矩阵进行 Hadamard 乘积操作,得到增强后的字符级语义特征:。
4.一种基于多层次自适应语义增强的中文医疗命名实体识别装置,其特征在于,包括存储器和一个或多个处理器,所述存储器中存储有可执行代码,所述一个或多个处理器执行所述可执行代码时,用于实现权利要求1‑3中任一项所述的基于多层次自适应语义增强的中文医疗命名实体识别方法。
5.一种计算机可读存储介质,其特征在于,其上存储有程序,该程序被处理器执行时,实现权利要求1‑3中任一项所述的基于多层次自适应语义增强的中文医疗命名实体识别方法。