1.一种基于梯度增强决策树的上下位词关系识别方法,其特征在于,包括如下步骤:(1)随机错位样本训练集的构建;
(2)基于路径的样本训练集的构建;
(3)根据构建得到的随机错位样本训练集、基于路径的样本训练集对半监督联合梯度增强决策树模型进行训练,并利用训练好的模型进行上下位词关系识别。
2.根据权利要求1所述的一种基于梯度增强决策树的上下位词关系识别方法,其特征在于:所述的随机错位样本训练集的构建方法为:(1.1)基于Alibaba Word Segmenter词法分析系统对语料文本进行分词;并从已有的词库中提取上下位词对进行匹配,结合词对之间的文本构造正样本;
(1.2)将成功匹配的词对上下位词错位,作为负样本词对;采用错位词对在文本进行匹配,构建随机错位负样本;
(1.3)将上述步骤得到的正负样本结合,构建得到随机错位样本训练集。
3.根据权利要求1所述的一种基于梯度增强决策树的上下位词关系识别方法,其特征在于:所述基于路径的样本训练集的构建方法为:(2.1)将语料文本碎片化,记作Ssplit=Split({S1,S2,S3,…,Sn});
(2.2)取随机错位样本中的错位词对,与语料文本进行匹配,得到含错位上下位词对的句子集合S
(2.3)将错位词对之间的路径取出,记作P={P1,P2,P3…,Pn};
(2.4)将这些路径提取后与语料碎片{S1,S2,S3,…,Sn}进行匹配,匹配成功后查询碎片原型句,取路径P′前后第一个但不是原有错位词对的词作为基于路径的负样本词对;与正样本结合得到基于路径的样本训练集。
4.根据权利要求3所述的一种基于梯度增强决策树的上下位词关系识别方法,其特征在于:所述的语料碎片化采用Ngarm算法,枚举所有连续的分词构成的句子碎片,每一个分词记作长度1,取路径长度不大于5的片段。
5.根据权利要求1所述的一种基于梯度增强决策树的上下位词关系识别方法,其特征在于:所述的半监督联合梯度增强决策树模型为加法模型,学习算法为前向分步算法,基函数为CART树;损失函数是均方误差函数损失,即:则负梯度:
其中,y-f(x)即为残差;输出是:分类树F(x)。
6.根据权利要求1所述的一种基于梯度增强决策树的上下位词关系识别方法,其特征在于:所述的半监督联合梯度增强决策树训练方法如下:输入:文本语料库T,预先训练的词嵌入和最大迭代I;
(i)对T进行数据预处理,提取两类训练样本Xp和Xd,其中Xp为基于路径的样本训练集,Xd为随机错位样本训练集;
(ii)利用词嵌入W将每个训练样本转换成向量表示;
(iii)设 和 X′p表示路径样本,X′d表示随机错位样本;
(iv)分别使用Xp∪X′p和Xd∪X′d用训练两个分类器f1和f2;
(v)对未标记样本进行预测,选择置信度高的正性样本作对新的训练样本X′p和X′d进行扩展;
(vi)循环步骤(iv)与步骤(v),直到X′p和X′d不在出现新的已标注样本;
输出:两个分类器和测试样本的预测标签。