1.一种自动打标签的方法,其特征在于,包括:
将待打标签文本进行分词预处理,得到预处理文本;
将预处理文本输入词语逆频率TF-IDF算法模型,得到待打标签文本的关键词集;
根据待打标签文本的关键词集得到初始化转移矩阵,由初始化转移矩阵及初始的关键词概率分布经过多次迭代相乘运算直至收敛后,得到关键词最终概率分布;
获取关键词最终概率分布中概率最大值的对应行,获取概率最大值的对应行所对应关键词,并将所述关键词设置为待打标签文本的标签。
2.根据权利要求1所述的自动打标签的方法,其特征在于,所述将待打标签文本进行分词预处理,得到预处理文本,包括:对待打标签文本进行分词,得到分词后文本;
对分词后文本包括的分词一一设置加权值;
删除分词后文本中的停用词,并统计各分词的词频,得到第一三元组;
获取第一三元组中词频大于预设词频阈值所对分词之间的词语相似度;
若分词之间的词语相似度大于预设词语相似度阈值,保留其中任意一个分词,得到第二三元组,并将第二三元组作为预处理文本。
3.根据权利要求2所述的自动打标签的方法,其特征在于,所述词语逆频率TF-IDF算法模型为:其中,TF部分分子ni,j表示词语ti在文本j中出现的次数,分母表示文本j中所有的词语频词和,IWF部分分子表示语料库中所有词语频数之和,nti表示词语ti在语料库中出现的总频数;
所述将预处理文本输入词语逆频率TF-IDF算法模型,得到待打标签文本的关键词集,包括:生成语料库词语统计结果集;
获取预处理文本;
将预处理文本及语料库词语统计结果集输入词语逆频率TF-IDF算法模型,得到待打标签文本的关键词集。
4.根据权利要求1所述的自动打标签的方法,其特征在于,所述根据待打标签文本的关键词集得到初始化转移矩阵中,所述初始化转移矩阵为n维方阵,n维方阵的维数与关键词集中关键词总个数相等;所述初始的关键词概率分布为每一行值均为1/n的n维列向量;其中,n为与关键词集中关键词总个数相等的正整数;
所述由初始化转移矩阵及初始的关键词概率分布经过多次迭代相乘运算记为Vm=MVm-1,其中,m为正整数,V0为初始的关键词概率分布,M为初始化转移矩阵。
5.根据权利要求4所述的自动打标签的方法,其特征在于,所述将待打标签文本进行分词预处理,得到预处理文本,之前包括:爬取待打标签文本,并存储至MongoDB数据库中。
6.一种自动打标签的装置,其特征在于,包括:
文本预处理单元,用于将待打标签文本进行分词预处理,得到预处理文本;
关键词集获取单元,用于将预处理文本输入词语逆频率TF-IDF算法模型,得到待打标签文本的关键词集;
最终概率分布获取单元,用于根据待打标签文本的关键词集得到初始化转移矩阵,由初始化转移矩阵及初始的关键词概率分布经过多次迭代相乘运算直至收敛后,得到关键词最终概率分布;
打标单元,用于获取关键词最终概率分布中概率最大值的对应行,获取概率最大值的对应行所对应关键词,并将所述关键词设置为待打标签文本的标签。
7.根据权利要求6所述的自动打标签的装置,其特征在于,所述文本预处理单元,包括:分词单元,用于对待打标签文本进行分词,得到分词后文本;
加权单元,用于对分词后文本包括的分词一一设置加权值;
统计单元,用于删除分词后文本中的停用词,并统计各分词的词频,得到第一三元组;
相似度获取单元,用于获取第一三元组中词频大于预设词频阈值所对分词之间的词语相似度;
删词单元,用于若分词之间的词语相似度大于预设词语相似度阈值,保留其中任意一个分词,得到第二三元组,并将第二三元组作为预处理文本。
8.根据权利要求7所述的自动打标签的装置,其特征在于,所述词语逆频率TF-IDF算法模型为:其中,TF部分分子ni,j表示词语ti在文本j中出现的次数,分母表示文本j中所有的词语频词和,IWF部分分子表示语料库中所有词语频数之和,nti表示词语ti在语料库中出现的总频数;
所述关键词集获取单元,包括:
第一处理单元,用于生成语料库词语统计结果集;
第二处理单元,用于获取预处理文本;
关键词集计算单元,用于将预处理文本及语料库词语统计结果集输入词语逆频率TF-IDF算法模型,得到待打标签文本的关键词集。
9.一种计算机设备,包括存储器、处理器及存储在所述存储器上并可在所述处理器上运行的计算机程序,其特征在于,所述处理器执行所述计算机程序时实现如权利要求1-5中任一项所述的自动打标签的方法。
10.一种存储介质,其特征在于,所述存储介质存储有计算机程序,所述计算机程序包括程序指令,所述程序指令当被处理器执行时使所述处理器执行如权利要求1-5任一项所述的自动打标签的方法。