1.一种篇章关系识别系统,其特征在于,包括篇章关系数据的自动标注子模块、融合领域共享与私有特征的隐式篇章关系识别子模块、带噪声过滤机制的对抗训练子模块、以及基于混合专家机制的领域泛化训练子模块;
在篇章关系数据的自动标注子模块中,基于启发式规则抽取K个领域的显式篇章关系实例,得到K个显式篇章关系数据集,将任一显式篇章关系数据集分为包含没有歧义的连接词的实例、以及包含有歧义的连接词的实例,分别对包含没有歧义的连接词的实例、包含有歧义的连接词的实例进行自动标注,然后合并自动标注结果,得到覆盖K个领域的、自动标注的人造隐式篇章关系数据集;
在融合领域共享与私有特征的隐式篇章关系识别子模块中,基于领域共享特征提取网络提取出人造隐式篇章关系数据集中各个实例的领域共享特征,基于领域私有特征提取网络提取出人造隐式篇章关系数据集中各个实例的领域私有特征,然后基于各个实例的领域共享特征和领域私有特征,分类层输出隐式篇章关系识别的预测结果;
在带噪声过滤机制的对抗训练子模块中,基于一个所有专家共享的领域判别层,预测得到训练实例在K个领域上的预测概率分布,并动态计算训练实例的权重,然后构建带噪声过滤机制的对抗训练阶段的代价函数L1,最小化代价函数L1,直到收敛;
在基于混合专家机制的领域泛化训练子模块中,定义领域专家与非领域专家组,然后对齐领域专家和非领域专家组,以构建代价函数L21,并在非领域专家组之间进行对齐,以构建代价函数L22,先后最小化代价函数L21和L22,直到收敛。
2.根据权利要求1所述的篇章关系识别系统,其特征在于,在篇章关系数据的自动标注子模块中,先基于启发式规则抽取K个领域的显式篇章关系实例,得到K个显式篇章关系数据集 , 、 、 分别为第1个、第k个、第K个显式篇章关系数据集,;
根据实例中的连接词是否有歧义,将 分为包含没有歧义的连接词的实例集 、以及包含有歧义的连接词的实例集 ;
对于 中的任一实例,先移除连接词,然后直接映射到相应的篇章关系类别,得到自动标注的第一人造隐式篇章关系数据集 ;
对于 中的任一实例,先移除连接词,然后使用两种性质不同的预训练模型预测适合连接两个论元的连接词,如果预测得到的两个连接词和原始的连接词不同,但都可以表示同一篇章关系,则保留实例并自动标注为对应的篇章关系;若预测得到的两个连接词和原始的连接词相同,或者,预测得到的两个连接词和原始的连接词不同,但不能表示同一篇章关系,丢弃实例,最后,得到自动标注的第二人造隐式篇章关系数据集 ;
合并 和 中的自动标注实例,得到第k个领域的自动标注的人造隐式篇章关系数据集 ,进而得到覆盖K个领域的、自动标注的人造隐式篇章关系数据集, 分别为第1个、第K个领域的自动标注的人造隐式篇章关系数据集。
3.根据权利要求2所述的篇章关系识别系统,其特征在于,在融合领域共享与私有特征的隐式篇章关系识别子模块中,先构建K个隐式篇章关系识别模型,并记为K个专家,然后基于领域共享特征提取网络提取出人造隐式篇章关系数据集中各个实例的领域共享特征,基于领域私有特征提取网络提取出人造隐式篇章关系数据集中各个实例的领域私有特征,表达式为:;
;
其中, 为 中的第 个实例, 为所有专家共有的领域共享特征提取网络,为第k个专家的领域私有特征提取网络, 为最大池化操作, 为 的领域共享特征, 为 的领域私有特征。
4.根据权利要求3所述的篇章关系识别系统,其特征在于,在融合领域共享与私有特征的隐式篇章关系识别子模块中,基于各个实例的领域共享特征和领域私有特征,分类层输出隐式篇章关系识别的预测结果,表达式为:;
;
其中, 为 在所有篇章关系类别上的预测概率分布, 为 的最终语义向量表示,为归一化函数, 和 为第k个专家的分类层需要学习的参数, 为向量拼接操作。
5.根据权利要求4所述的篇章关系识别系统,其特征在于,在带噪声过滤机制的对抗训练子模块中,基于一个所有专家共享的领域判别层,预测得到训练实例在K个领域上的预测概率分布,表达式为:;
其中, 为 在所有K个领域上的预测概率分布, 和 为领域判别层需要学习的参数。
6.根据权利要求5所述的篇章关系识别系统,其特征在于,在带噪声过滤机制的对抗训练子模块中,动态计算训练实例的权重的过程中,满足下式:;
其中, 为 的权重, 为 的自动标注的人造隐式篇章关系, 为用于分类的交叉熵代价函数, 为用于计算熵的函数, 和 为设定的超参数。
7.根据权利要求6所述的篇章关系识别系统,其特征在于,带噪声过滤机制的对抗训练阶段的代价函数L1的表达式为:;
其中, 为 中训练实例的总数量, 为向量的转置操作。
8.根据权利要求7所述的篇章关系识别系统,其特征在于,代价函数L21的表达式为:;
;
其中, 表示Kullback‑Leibler距离计算函数, 为非领域专家组的预测结果,为非领域专家组中第 个专家的预测结果。
9.根据权利要求8所述的篇章关系识别系统,其特征在于,代价函数L22的表达式为:;
;
;
其中, 是由未标注隐式篇章关系实例构建的数据集, 为 中实例的总数,为 中的第 个实例, 为第一个非领域专家组 对 的预测结果, 为第二个非领域专家非领域专家 对 的预测结果, 为第一个非领域专家组 中非领域专家的数量, 为第二个非领域专家非领域专家 中非领域专家的数量, 为第一个非领域专家组 中第 个非领域专家对 的预测结果, 为第二个非领域专家组 中第个非领域专家对 的预测结果。