1.一种融合实体标签编码的小样本学习命名实体识别方法,其特征在于,包括以下步骤:步骤(1)构建数据集,数据集中包含若干样本以及对应样本标注的实体标签;
步骤(2)使用Bert将输入句子中的每个字符进行字嵌入转化,得到字符特征序列;
步骤(3)利用CLN将步骤(2)的字符特征序列表示成词对特征矩阵V,同时计算各个字符之间的距离表示成距离特征矩阵Ed,以及一个上下三角区域特征矩阵Et,将三个特征矩阵的特征进行拼接得到词对关系特征矩阵C;
步骤(4)将每个实体标签进行自然语言的转换,再使用Bert对这些标签进行编码,得到每个实体标签的特征表示L;
步骤(5)对于词对关系特征矩阵C中的每个词对关系特征表示,与每个实体标签的特征表示计算点积相似度,得到每个词对与每个实体标签的转移概率矩阵;
步骤(6)用标注样本对步骤(2)‑步骤(5)组成的模型进行训练,选取最优模型作为最终的预训练模型;
步骤(7)载入预训练模型,标注样本进行小样本学习,将句子输入到训练好的模型中,输出词对关系矩阵Y,对词对关系矩阵进行解码,得到最终的实体词及其类型。
2.根据权利要求1所述的一种融合实体标签编码的小样本学习命名实体识别方法,其特征在于,所述步骤(2)具体实现过程如下:使用Bert将输入句子中的每个字符进行字嵌入转化,得到字符级别的嵌入表示;对于N长度为N的输入句子X={x1,x2,…,xN}∈R ,用Bert对其每一个字符xi进行编码,得到字符特征序列 dh为字符特征的维度,R为表示特征的维度。
3.根据权利要求2所述的一种融合实体标签编码的小样本学习命名实体识别方法,其特征在于,所述步骤(3)中,词对特征矩阵V的获取方法:利用CLN将的字符特征序列表示成词对特征矩阵 其中Vij的计算公式为:
Vij为hi关于hj的特征表示,其中γij=Wαhi+bα,λij=Wβhi+bβ经过全连接层训练得到,Wα和Wβ是可学习的权重矩阵,bα和bβ是可学习的偏置向量,μ和σ是hi的均值和标准差,其公式如下所示:其中dh为字符特征的维度,hjk为字符特征序列H中第j个字符特征的第k个元素。
4.根据权利要求3所述的一种融合实体标签编码的小样本学习命名实体识别方法,其特征在于,所述步骤(3)中,距离特征矩阵Ed的获取方法:计算各个字符特征之间的距离得到距离特征矩阵 对于输入的句子
X,两个词(xi,xj)之间的距离表示为这两个词的绝对距离|i‑j|,再经过一个嵌入层,得到距离的分布式表示的距离特征矩阵
5.根据权利要求4所述的一种融合实体标签编码的小样本学习命名实体识别方法,其特征在于,所述步骤(3)中,区域网络矩阵 通过手动生成,设置一块N×N的矩阵,对于此矩阵的上三角区域,所有值设置为1,下三角区域则设置为2,再经过一个嵌入层,得到上下三角区域特征矩阵
6.根据权利要求3‑5所述的一种融合实体标签编码的小样本学习命名实体识别方法,其特征在于,所述步骤(3)中,将所述词对特征矩阵V、距离特征矩阵Ed和上下三角区域特征矩阵Et这三个特征矩阵的特征进行拼接得到词对关系特征矩阵其中
7.根据权利要求6所述的一种融合实体标签编码的小样本学习命名实体识别方法,其特征在于,所述步骤(4)具体实现过程如下:将每个实体标签进行自然语言的转换,W2NER中定义了两种词词关系,一种是相邻关系,表示两个词之间是可以相邻的,另一种是实体关系,表示两个词分别作为一个实体的头和尾,所以标签的数量为实体类型的数量+2,所述标签分别为相邻关系标签和无关系标签,同时再使用Bert对这些标签进行编码,得到每个实体标签的特征表示
8.根据权利要求7所述的一种融合实体标签编码的小样本学习命名实体识别方法,其特征在于,所述步骤(5)具体实现过程如下:对于每个词对关系特征表示ci,i∈{1,2,…,N×N},与每个实体标签的特征表示lj,j∈{1,2,…,NL}计算点积相似度,经过Softmax运算,得到每个词对与每个实体标签的转移概率矩阵,其计算公式如下:yij=softmax(ci·lj)。
9.根据权利要求8所述的一种融合实体标签编码的小样本学习命名实体识别方法,其特征在于,所述步骤(6)中,Bert预训练模型选择“bert‑base‑uncased”,epoch设置为5,学习率为0.00001,batch size为4,使用Adam优化器渐进式的调整学习率,利用标准的交叉熵损失来训练模型,公式如下:其中, 表示是否为正确标签,yij为预测的的转移概率,
多轮训练结束后,选取最优的模型作为预训练模型。
10.根据权利要求9所述的一种融合实体标签编码的小样本学习命名实体识别方法,其特征在于,所述步骤(7)中,载入完成训练后的最优模型,以k‑shot的方式对数据集进行采样,对于n‑shot,从每个实体类型中,随机采样n条语料作为输入继续训练;Bert预训练模型选择“bert‑base‑uncased”,epoch设置为100,学习率为0.00001,batch size为4,使用Adam优化器渐进式的调整学习率,利用标准的交叉熵损失来训练模型;
N×N
小样本训练结束后,将句子输入到训练好的模型中,输出词对关系矩阵Y∈R ,对词对关系矩阵进行解码,得到最终的实体词及其类型。