1.一种基于药物实体词掩码和Insert‑BERT结构的药物关系抽取方法,其特征在于,包括以下步骤:
S1、在输入层的单词序列掩码MASK阶段,基于构建的药物名称实体库上,采用字符串匹配的方式实现药物实体检测;
S2、在输入阶段,仅随机选择其中一个药物实体进行掩码,对于句子中剩下的非实体单词,遵循常规的BERT掩码策略;
S3、在预训练的Entity‑Mask‑BERT的基础上,通过引入标志实现组合进行区分,从而构建Insert‑BERT结构的药物关系分类,以达到同一输入句子序列中不同药物实体关系的抽取的目的;
S4、为区分同一输入句子包含不同实体组合的问题,新增START1、END1、STRAT2和END2四个符号,从而使得相同的输入句子序列在输入层具有不同的表示;
S5、Insert‑BERT模型训练前期采用基于warmup+三角学习率的优化策略,在训练的后期,随着模型的逐渐收敛,不断降低学习率以便微调模型。
2.根据权利要求1所述的基于药物实体词掩码和Insert‑BERT结构的药物关系抽取方法,其特征在于,在步骤S2中,在输入句子中存在多个实体的情况下,掩码其中一个药物实体并利用其他药物实体去预测当前掩码实体的策略,可基于海量的描述药物机理数据实现无监督的高频药物实体关系建模并完成预训练任务。
3.根据权利要求1所述的基于药物实体词掩码和Insert‑BERT结构的药物关系抽取方法,其特征在于,在步骤S3中,对于输入句子序列X=[x1,x2,e3,x4,e5···e10,···xM];
其中,M表示输入句子中包含的单词总数;
e3、e5和e10分别表示3个药物实体;
x1,x2,x4,··xM表示非药物实体;
下游分类任务需要判断[e3,e5]、[e3,e10]以及[e3,e10],这3种药物实体组合之间的关系,且实体组合共用同一个输入序列X。
4.根据权利要求1所述的基于药物实体词掩码和Insert‑BERT结构的药物关系抽取方法,其特征在于,在步骤S4中,新增START1、END1、STRAT2和END2四个符号,以判断实体组合[en,em]之间的关系。
5.根据权利要求4所述的基于药物实体词掩码和Insert‑BERT结构的药物关系抽取方法,其特征在于,判断实体组合[en,em]之间的关系的方法为:S40、在en的前后插入符号START1和END1,标志第一个实体所在位置;
S41、在em的前后插入符号START2和END2,标志第二个实体所在位置;
S42、同理,实体组合[en,ev]以及[em,ev]均进行类似操作,一个包含N个实体的输入句子将生成 种输入序列,从而使得相同的输入句子序列在输入层具有不同的表示。
6.根据权利要求1所述的基于药物实体词掩码和Insert‑BERT结构的药物关系抽取方法,其特征在于,在步骤S5中,构建的Insert‑BERT模型,其主要编码单元为Transformer,该编码单元的参数均以Entity‑MASK‑Bert预训练得到的Transformer参数作为初始化。
7.根据权利要求5所述的基于药物实体词掩码和Insert‑BERT结构的药物关系抽取方k
法,其特征在于,在模型的训练阶段,假设[CLS]节点的输出表示为r∈R;
k×c
S50、定义转移矩阵W∈R 实现输出表示空间到类别概率空间的映射:o=rw;
c
其中,o=(o1,···,oj,···,oc)∈R表示每个类别的未归一化的概率;
k和c分别代表输出向量维度和药物实体关系的类别数目;
S51、利用Softmax函数将未归一化的概率空间o转化到归一化的概率空间s,如下式所示:
其中, 表示第l个输入句子中第p个药物实体对;
表示 属于类别cj的概率;
S52、以步骤S51中公式为优化目标完成Insert‑BERT模型训练:其中,L表示训练集中样本总数;
nl表示第l个样本中包含药物实体对的数量;
分别表示第l个样本中第p个药物实体对的真实值和预测值。
8.根据权利要求7所述的基于药物实体词掩码和Insert‑BERT结构的药物关系抽取方法,其特征在于,在Insert‑BERT模型训练和微调过程中,batch‑size、学习率分别设置为16和2e‑5。