1.一种基于改进互信息函数的科技文本分类方法,其特征在于,所述方法包括以下步骤:S1、构建科技文本数据库,进行数据预处理,包括对数据库中的科技文本进行数据融合,通过对目标文本进行分词,通过word2vec模型得出词向量;
S2、构建文本特征提取模型,并为每个词向量根据TF-ATF模型计算权值,统计特征词出现次数不少于min次的文本数据,并根据权值更新词向量的表示;
S3、构建改进互信息函数,计算文本中所有词向量的互信函数值,并根据互信息函数值更新词向量的表示;
S4、构建语义距离模型,将符合要求的同义词或近义词进行合并,并剔除其中权值较小的词,将合并后的词向量进行正则化,得到最终的文本特征向量;
S5、利用LSTM模型对文本特征向量进行训练,利用训练好的模型对科技文本进行分类。
2.根据权利要求1所述的一种基于改进互信息函数的科技文本分类方法,其特征在于,目标文本为科技文本信息,科技文本信息包括科技项目数据、科技企业数据、科技金融服务数据、科技人才数据,针对来源不同、数据结构不同的数据进行多源异构数据的融合。
3.根据权利要求2所述的一种基于改进互信息函数的科技文本分类方法,其特征在于,针对来源不同、数据结构不同的数据进行多源异构数据的融合过程包括:将数据所属数据表名作为本体名,将文本类型数据表直接构建为一个本体对象,若不是文本类型数据则读取该数据的表头作为本体类,同时循环的读取该表每一行的数据创建本体对象;
读取完所有数据表之后进行本体的融合,寻找不同本体类之间相同的属性作为结合点,创建一个空的本体,本体类为待融合的本体类的并集,复制待融合本体对象到该本体中,同时删除多余的结合点数据,完成本体的融合;
对于非文本类型的本体对象,通过本体类名加上本体对象值的形式转化为文本类型的本体对象,并通过文本拼接的方式,将相同本体类的文本数据组合为一个本体对象。
4.根据权利要求1所述的一种基于改进互信息函数的科技文本分类方法,其特征在于,对目标文本进行分词包括:利用字符串处理划分出目标文本的句子,并对句子进行清洗,如果含有特殊字符,则将其分离;
根据词典建立的Trie字典树、根据清洗后的句子建立DAG词图,计算全局概率Route得到基于前缀词典的词频最大切分组合;
将词典中出现的词直接输出,未出现的词利用Token识别将中文英文数字分开进行处理;
对于除中文以外的字符直接输出,中文字符里面HMM概率图模型并利用Viterbi动态规划取得分词和标注并输出。
5.根据权利要求1所述的一种基于改进互信息函数的科技文本分类方法,其特征在于,词向量转换模型word2vec包括:将文本数据进行One-Hot编码处理转换为词汇表向量;
将词汇表向量输入到Skip-gram模型根据每个词汇相邻关系进行向量转换,缩减词汇表维度;
输出词向量并添加值为零的权值参数,输出为 其中,X为添加权值参数之后的词向量表示,xi为词向量,ωi为权值参数。
6.根据权利要求1所述的一种基于改进互信息函数的科技文本分类方法,其特征在于,根据TF-ATF模型计算权值包括:其中,TF(t)代表特征词t的词频;ATF(t)为特征词t的平均词频类间集中度;DF(t,Ci)代表特征词t在Ci类中所出现的文档频率;DF(t)代表特征词t在训练样本中出现的文档频度;
代表特征词在文档频类间集中度。
7.根据权利要求1所述的一种基于改进互信息函数的科技文本分类方法,其特征在于,计算文本中所有词向量的互信函数值,并更新词向量的表示时,利用互信息函数值作为特征的权值来更新词向量表示,改进互信息函数表示为:其中,αi代表词频类间集中度,表示为 tfi(t)表示特征词t在该类文本中出现的次数,m是总文本类别数;βi代表文档频数内的分散度和集中度,表示为dfi(t)表示文本类别特征数量,|ci|表示该类文本的数量,P(ti,cj)代表文本中某一个特征ti在文本的某个类别ci中出现的概率,P(ti)代表特征ti出现的概率,P(cj)代表类别ci出现的概率。
8.根据权利要求1所述的一种基于改进互信息函数的科技文本分类方法,其特征在于,构建语义距离模型包括:将特征向量表示为 其中xi代表特征词的词向量表示,ωi表示该词的文本特征模型,n表示特征词的数量;
计算两个特征词的相似度Sim(wi,wj),相似度大于设定阈值的两个特征词属于近义词或同义词;
计算两个特征词的相关度Rels(wi,wj),如果两个特征词之间相关度大于设定阈值的两个特征词属于近义词或同义词;
根据通过 判断是否对同义词、近义词
进行合并,若SR的值大于设定阈值则将两个特征词向量的权值进行相加,即ω=ωi+ωj,同时删除词频较小的特征词,以词频较大的特征词作为合并后的代表词向量X=(x,ω);
其中,为特征词相似度系数,取值为(0,1)。
9.根据权利要求1所述的一种基于改进互信息函数的科技文本分类方法,其特征在于,对词向量进行正则化,表示为:其中,L代表正则项;Ein是未包含正则化项的训练样本误差,λ是正则化参数, 为词向量参数的平方和。
10.根据权利要求1所述的一种基于改进互信息函数的科技文本分类方法,其特征在于,步骤S5具体包括:对LSTM模型中的神经单元进行改进,将神经单元转化为输入门、遗忘门和输出门,使得遗忘门中长期状态更新表示为:计算获取到长期状态Ct之后,计算该时刻的输出分类结果ht,表示为:其中,ft为遗忘门函数;σ1为遗忘系数;Wf为遗忘门权值;ht-1为上一个神经元计算结果;
bf为遗忘门偏置;it为输入门函数;σ2为输入门函数系数;bi为输入门偏置; 为短期状态;
Wc为短期状态参数;bc为短期状态偏置;Ct为长期状态;ot为输出函数,σ3为输出函数系数,Wf为输出函数的参数,xt为t时刻的词向量,bo为输出函数的偏置。