利索能及
我要发布
收藏
专利号: 2020104141767
申请人: 北京极兆技术有限公司
专利类型:发明专利
专利状态:已下证
更新日期:2025-10-10
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于机器学习获得商品对应国民经济制造业的方法,其特征在于,所述方法包括如下步骤:S1,采集有标签的商品分类数据作为初始训练样本集利用机器学习算法训练初始深度学习模型,所述初始深度学习模型为长短时记忆循环神经网络;

S2,利用所述初始深度学习模型对无标签数据进行分类,根据分类结果对所述初始深度学习模型进行迭代训练得到用于将商品进行底层类别分类的第一商品分类预测模型;

S3,根据国家标准商品体系中的制造行业体系建立商品知识图谱数据库,在所述商品知识图谱数据库中提取目标商品的文本格式商品数据;利用所述第一商品分类预测模型根据机器学习算法对所述目标商品的文本格式商品数据进行归一化分类得到文本格式底层商品分类数据;再将所述文本格式底层商品分类数据转变为数值化的向量,利用向量比较算法判断文本的相似性从而得出商品分类与国民经济制造业行业的映射关系;

S4,将所述文本格式底层商品分类数据与所述映射关系作为训练样本,对所述第一商品分类预测模型进行迭代训练,得到用于反映商品到国民经济制造业行业的映射关系的第二商品分类预测模型;

S5,所述第二商品分类预测模型根据输入的任一商品的文本格式的商品数据得到所述任一商品所对应的国民经济制造业行业。

2.根据权利要求1所述的方法,其特征在于,在步骤S3中,所述第一、第二商品分类预测模型均为长短时记忆循环神经网络。

3.根据权利要求2所述的方法,其特征在于,所述长短时记忆循环神经网络为双向长短时记忆循环神经网络。

4.根据权利要求1~3中任一项所述的方法,其特征在于,在步骤S3中,所述将所述文本格式底层商品分类数据转变为数值化的向量,利用向量比较算法判断文本的相似性从而得出商品分类与国民经济制造业行业的映射关系包括步骤:S31,将所述文本格式底层商品分类数据中每一个类别中的每一个汉字或字符进行数值化编码,得到每一个汉字或字符的300维度的向量表示,按照原始底层商品分类数据中的每一个类别中每一个汉字或字符的先后顺序将数值化编码后的每一个汉字或字符对应的向量依次进行矢量相加,分别得到各类别所对应的第一向量;

S32,将国民经济制造业行业中底层类别中每一个类别所对应的每一个汉字或字符进行数值化编码,得到每一个汉字或字符的300维度的向量表示,按照每一个类别中每一个汉字或字符的先后顺序将数值化编码后的每一个汉字或字符对应的向量依次进行矢量相加,分别得到各类别所对应的第二向量;

S33,利用向量比较算法判断所述各第一向量和所述各第二向量的相似性,得到商品分类与国民经济制造业行业的初始映射关系,并对所述初始映射关系进行校正得到最终正确的映射关系。

5.根据权利要求4所述的方法,其特征在于,在步骤S33中,所述向量比较算法为余弦相似度向量比较算法。

6.根据权利要求4所述的方法,其特征在于,每一个汉字或字符的300维度的向量的具体数值是归一化后的数值,和为1。

7.一种基于机器学习获得商品对应国民经济制造业的系统,其特征在于,包括:

初始深度学习模型训练模块,用于采集有标签的商品分类数据作为初始训练样本集利用机器学习算法训练初始深度学习模型,所述初始深度学习模型为长短时记忆循环神经网络;

第一商品分类预测模型训练模块,用于利用所述初始深度学习模型对无标签数据进行分类,根据分类结果对所述初始深度学习模型进行迭代训练得到用于将商品进行底层类别分类的第一商品分类预测模型;

第二商品分类预测模型训练模块,用于根据国家标准商品体系中的制造行业体系建立商品知识图谱数据库,在所述商品知识图谱数据库中提取目标商品的文本格式商品数据;

利用所述第一商品分类预测模型根据机器学习算法对所述目标商品的文本格式商品数据进行归一化分类得到文本格式底层商品分类数据;再将所述文本格式底层商品分类数据转变为数值化的向量,利用向量比较算法判断文本的相似性从而得出商品分类与国民经济制造业行业的映射关系;然后将所述文本格式底层商品分类数据与所述映射关系作为训练样本,对所述第一商品分类预测模型进行迭代训练,得到用于反映商品到国民经济制造业行业的映射关系的第二商品分类预测模型;

分类模块,用于利用所述第二商品分类预测模型根据输入的任一商品的文本格式的商品数据得到所述任一商品所对应的国民经济制造业行业。

8.根据权利要求7所述的系统,其特征在于,所述第一、第二商品分类预测模型均为长短时记忆循环神经网络。

9.根据权利要求7所述的系统,其特征在于,所述第一、第二商品分类预测模型为双向长短时记忆循环神经网络。

10.根据权利要求7所述的系统,其特征在于,所述第二商品分类预测模型训练模块采用的向量比较算法为余弦相似度向量比较算法。