利索能及
我要发布
收藏
专利号: 202010339579X
申请人: 梁华智能科技(上海)有限公司
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-04
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种中文分词的消歧处理方法,其特征在于,所述方法包括:获取待消歧文本数据;

对所述待消歧文本数据进行分词处理,获得初始分词结果;

获取所述初始分词结果的词向量,根据所述词向量的语法语义和上下文逻辑推理相关的神经网络输出值迭代更新初始分词结果,确定消歧后的分词结果;

所述根据所述词向量的语法语义和上下文逻辑推理相关的神经网络输出值迭代更新初始分词结果,确定消歧后的分词结果包括:设置迭代初始值P1=0,将三角矩阵S0的上三角阵和下三角阵合并填充到变换矩阵S1的下三角阵中,使得变换矩阵S1的非对角线区域发生排斥;

确定处于排斥作用下的变换矩阵S1中各矩阵元的减值;

当减值将所述矩阵元减少至小于最小阈值时,则将矩阵元的值设置为最小阈值,并在迭代完成后,对所有矩阵元进行归一处理;

更新变换矩阵S1的下三角阵P1,使得下三角阵P1的矩阵元总和为M;

判断所述矩阵元的值是否满足迭代收敛条件,若不满足,则继续迭代计算,若满足,选取矩阵元大于零的稳定值对应的词向量作为消歧后的分词结果;

如果迭代过程不收敛或其他异常则返回此次分词不成功标志。

2.如权利要求1所述的方法,其特征在于,所述获得初始分词结果包括:根据待消歧文本数据中各字符在预先建立的语料数据库中的成词强度,确定待消歧文本数据的成词倾向;

基于待消歧文本数据的成词倾向构建M*M的三角矩阵S0,使得生成的所述三角矩阵S0中的每个矩阵元均对应一个词向量。

3.如权利要求2所述的方法,其特征在于,所述基于待消歧文本数据的成词倾向构建M*M的三角矩阵S0包括:将所述待消歧文本数据中各字符在预先建立的语料数据库中的成词强度P0和与语法分析、上下文逻辑推理相关的神经网络输出值P1分别放置于三角矩阵S0的上三角阵和下三角阵。

4.如权利要求2所述的方法,其特征在于,通过下式确定待消歧文本数据的成词倾向:P=P0+P1

其中,P0表示将所述待消歧文本数据中各字符在预先建立的语料数据库中的成词强度;

P1表示与语法分析、上下文逻辑推理相关的神经网络输出值。

5.如权利要求4所述的方法,其特征在于,通过下式确定所述待消歧文本数据中各字符在预先建立的语料数据库中的成词强度:P0=1‑exp(‑N/Nb)

式中,N表示词向量在语料数据库中出现的次数,Nb表示语料数据库相关的统计参数。

6.根据权利要求1所述的方法,其特征在于,所述收敛条件包括:所述下三角阵P1中,无互斥且小于预设数量的矩阵元大于零,其他矩阵元均为零或者等于最小阈值。

7.如权利要求1所述的方法,其特征在于,所述区域内的矩阵元的减值通过计算变换矩阵S1的每个矩阵元与区域系数λr的乘积获得。

8.如权利要求2所述的方法,其特征在于,所述语料数据的预先建立包括:将预先采集的文本数据转换为同一种编码格式;

对所述同一种编码格式的文本数据进行数据清洗;

筛除经过数据清洗后的所述文本数据中的停用词,得到语料数据,构成语料数据库。

9.一种中文分词的消歧处理系统,其特征在于,所述系统包括:获取模块,用于获取待消歧文本数据;

分词模块,用于对所述待消歧文本数据进行分词处理,获得初始分词结果;

消歧处理模块,用于获取所述初始分词结果的词向量,根据所述词向量的语法语义和上下文逻辑推理相关的神经网络输出值迭代更新初始分词结果,确定消歧后的分词结果;

所述消歧处理模块中,根据所述词向量的语法语义和上下文逻辑推理相关的神经网络输出值迭代更新初始分词结果,确定消歧后的分词结果包括:设置迭代初始值P1=0,将三角矩阵S0的上三角阵和下三角阵合并填充到变换矩阵S1的下三角阵中,使得变换矩阵S1的非对角线区域发生排斥;

确定处于排斥作用下的变换矩阵S1中各矩阵元的减值;

当减值将所述矩阵元减少至小于最小阈值时,则将矩阵元的值设置为最小阈值,并在迭代完成后,对所有矩阵元进行归一处理;

更新变换矩阵S1的下三角阵P1,使得下三角阵P1的矩阵元总和为M;

判断所述矩阵元的值是否满足迭代收敛条件,若不满足,则继续迭代计算,若满足,选取矩阵元大于零的稳定值对应的词向量作为消歧后的分词结果;

如果迭代过程不收敛或其他异常则返回此次分词不成功标志。