1.一种基于拼音嵌入增强和多层信息融合的中文机器阅读理解方法,包括以下步骤:步骤1:对数据集进行预处理,将数据集处理成包含上下文C,问题Q和答案A构成的三元组,将数据集D表示为{Di∣Di=(C,Q,A),1≤i≤n},其中n表示数据集D的大小,Di代表数据集的第i个数据,答案A是上下文C中的一个连续子串;
步骤2:对步骤1处理得到的数据进行中文分词操作,得到文本的词语序列,将得到的中文词语序列,通过一个卷积网络,来获得中文词语的拼音嵌入向量PE;
步骤3:基于步骤1得到的数据通过标识[CLS]和[SEP],将段落和问题进行拼接,然后输入到BERT中,利用BERT的wordpiece中文分词,得到每个词的词嵌入向量Etoken;
步骤4:基于步骤2和步骤3分别得到的拼音嵌入PE和词嵌入Etoken,通过一个全连接层,得到一个融合拼音嵌入向量的融合词嵌入FE;接着再与输入序列的段嵌入Eseg和位置嵌入Epos进行相加,得到完整的输入序列的嵌入向量w;
步骤5:基于步骤4得到的序列嵌入向量进行BERT编码,这样可以得到不同编码层输出的编码向量表示;
步骤6:基于步骤5的操作,将BERT模型前六层编码器获得的编码表示与步骤5得到的词Cl嵌入表示进行多层注意力融合计算,得到融合低层级问题语义信息的上下文表示向量v ,其中C表示上下文,l表示低层级信息融合;
步骤7:对步骤6得到的上下文编码表示与第六层的问题编码表示输入到第七层编码器中,依次会得到第七层到第十一层编码器的编码表示,再与步骤5的词嵌入向量和步骤6得到的低层级编码表示进行多层注意力融合计算,得到融合高层级问题语义信息的上下文表Ch示向量v ,其中C表示上下文,h表示高层级信息融合;
步骤8:基于步骤7得到的高层级的上下文表示与第十一层编码器的问题表示向量输入到最后一个编码器中,利用编码器的自注意力,得到最终的融合多层信息的上下文语义向量 其中C表示上下文,Q表示问题,m和n分别表示上下文和问题的长度,L12表示第十二层编码器得到的编码表示,h代表低层级编码向量;
步骤9:基于步骤8得到的句向量表示,通过softmax函数预测每个位置作为答案起始点和结束点的概率分布,最终遍历所有可能的起始点和结束点组合,选择概率乘积最大的组合来确定答案的跨度。
2.如权利要求1所述的一种基于拼音嵌入增强和多层信息融合的中文机器阅读理解方法,其特征在于,步骤2具体包括:设汉字拼音数量为len,对每个汉字的拼音随机初始化一个pd维向量,形成拼音矩阵 将中文文本转换为拼音序列x=[x1,x2,…,xlx],通过PV将每个拼音序列映射为相应的拼音向量,得到矩阵px=[x1,x2,…,xlx];其中xi=PV(xi),1≤i≤lx,表示拼音xi对应的拼音向量,lx表示汉字的数量;通过对拼音序列进行卷积操作,再进行最大池化,得到拼音嵌入表示PE。
3.如权利要求1所述的一种基于拼音嵌入增强和多层信息融合的中文机器阅读理解方法,其特征在于,步骤4的嵌入向量w使用能表示为w=FE+Eseg+Epos,其中FE=concat(Etoken,PE)Wfc+bfc,其中Wfc表示全连接层的权重,Wfc表示全连接层的偏置,
4.如权利要求1所述的一种基于拼音嵌入增强和多层信息融合的中文机器阅读理解方法,其特征在于,步骤5具体包括:利用BERT中的encoder编码器对输入序列中的单词的语义信息进行建模,得到输入序列的每一层编码输出;给定输入序列的嵌入向量w,输入到BERT模型中:其中C表示上下文段落,Q表示问题,m和n分别表示上下文和问题的长度,Li表示第i层编码器得到的编码表示,1≤i≤6,l代表低层级编码向量;同理,可以得到前六层编码器的编码表示。
5.如权利要求4所述的一种基于拼音嵌入增强和多层信息融合的中文机器阅读理解方法,其特征在于,步骤6具体包括:定义关于上下文和问题的两组向量和 将词级别和前六层的编码向量进行
拼接,将问题Q中的所有低层级信息融合到上下文C中:
中WC和WQ表示可学习的权重矩阵,v表示权重向量,接着通过一个softmax得到注意力权重: 最终得到 接着,使用BiLSTM对得到的 和表示向量进行编码,得到了低层级融合信息的上下文表示向量:
6.如权利要求5所述的一种基于拼音嵌入增强和多层信息融合的中文机器阅读理解方法,其特征在于,步骤7具体包括:通过第七层编码层获得其中,h表示高层级的编
码操作;第七层到第十一层的编码表示为 和
将问题Q中的高层级语义信息融合到上下文,得到 构建高层级融合信息的
上下文表示:
7.如权利要求6所述的一种基于拼音嵌入增强和多层信息融合的中文机器阅读理解方法,其特征在于,步骤8所述的融合多层信息的上下文语义向量,具体是指:利用BERT的最后一层编码器对高层级上下文表示进行自注意力计算,得到融合问题中全部层次信息的上下文编码向量:
8.如权利要求1所述的一种基于拼音嵌入增强和多层信息融合的中文机器阅读理解方法,其特征在于,步骤9具体包括:设输入上下文长度为M,模型会输出Pstart和Pend:其中,si和ei分别表示模型预测的第i个位置作为答案的起始点和结束点的得分;最终是选择联合概率最高的起始点和结束点:Pjoint(i,j)=Pstart(i)×Pend(j),通过遍历所有可能的起始点和结束点组合,选择使Pjoint最大的组合(i,j),就是最终确定的答案跨度;
模型的损失函数采用交叉熵损失函数,用于衡量模型预测的答案与实际答案之间的差异性,具体计算公式如下:其中,ystart和yend分别表示实际答案的开始和结束位置的真是标签向量,最终,将开始和结束位置的损失进行加权求和,得到完整的损失函数:Loss=λ·Lossstart+(1‑λ)·Lossend (4)其中,λ是一个权重参数,用于平衡开始和结束位置的损失。
9.一种基于拼音嵌入增强和多层信息融合的中文机器阅读理解装置,其特征在于,包括存储器和一个或多个处理器,所述存储器中存储有可执行代码,所述一个或多个处理器执行所述可执行代码时,用于实现权利要求1‑8中任一项所述的基于拼音嵌入增强和多层信息融合的中文机器阅读理解方法。
10.一种计算机可读存储介质,其特征在于,其上存储有程序,该程序被处理器执行时,实现权利要求1‑8中任一项所述的基于拼音嵌入增强和多层信息融合的中文机器阅读理解方法。