利索能及
我要发布
收藏
专利号: 2019110866200
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-06
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于梯度增强决策树的上下位词关系识别方法,其特征在于,包括如下步骤:(1)随机错位样本训练集的构建;

(2)基于路径的样本训练集的构建;

(3)根据构建得到的随机错位样本训练集、基于路径的样本训练集对半监督联合梯度增强决策树模型进行训练,并利用训练好的模型进行上下位词关系识别。

2.根据权利要求1所述的一种基于梯度增强决策树的上下位词关系识别方法,其特征在于:所述的随机错位样本训练集的构建方法为:(1.1)基于Alibaba Word Segmenter词法分析系统对语料文本进行分词;并从已有的词库中提取上下位词对进行匹配,结合词对之间的文本构造正样本;

(1.2)将成功匹配的词对上下位词错位,作为负样本词对;采用错位词对在文本进行匹配,构建随机错位负样本;

(1.3)将上述步骤得到的正负样本结合,构建得到随机错位样本训练集。

3.根据权利要求1所述的一种基于梯度增强决策树的上下位词关系识别方法,其特征在于:所述基于路径的样本训练集的构建方法为:(2.1)将语料文本碎片化,记作Ssplit=Split({S1,S2,S3,…,Sn});

(2.2)取随机错位样本中的错位词对,与语料文本进行匹配,得到含错位上下位词对的句子集合S={S,S,S,…,S};

(2.3)将错位词对之间的路径取出,记作P={P1,P2,P3…,Pn};

(2.4)将这些路径提取后与语料碎片{S1,S2,S3,…,Sn}进行匹配,匹配成功后查询碎片原型句,取路径P′前后第一个但不是原有错位词对的词作为基于路径的负样本词对;与正样本结合得到基于路径的样本训练集。

4.根据权利要求3所述的一种基于梯度增强决策树的上下位词关系识别方法,其特征在于:所述的语料碎片化采用Ngarm算法,枚举所有连续的分词构成的句子碎片,每一个分词记作长度1,取路径长度不大于5的片段。

5.根据权利要求1所述的一种基于梯度增强决策树的上下位词关系识别方法,其特征在于:所述的半监督联合梯度增强决策树模型为加法模型,学习算法为前向分步算法,基函数为CART树;损失函数是均方误差函数损失,即:则负梯度:

其中,y-f(x)即为残差;输出是:分类树F(x)。

6.根据权利要求1所述的一种基于梯度增强决策树的上下位词关系识别方法,其特征在于:所述的半监督联合梯度增强决策树训练方法如下:输入:文本语料库T,预先训练的词嵌入和最大迭代I;

(i)对T进行数据预处理,提取两类训练样本Xp和Xd,其中Xp为基于路径的样本训练集,Xd为随机错位样本训练集;

(ii)利用词嵌入W将每个训练样本转换成向量表示;

(iii)设 和 X′p表示路径样本,X′d表示随机错位样本;

(iv)分别使用Xp∪X′p和Xd∪X′d用训练两个分类器f1和f2;

(v)对未标记样本进行预测,选择置信度高的正性样本作对新的训练样本X′p和X′d进行扩展;

(vi)循环步骤(iv)与步骤(v),直到X′p和X′d不在出现新的已标注样本;

输出:两个分类器和测试样本的预测标签。