1.一种轻量化的化工文献相似度计算方法,其特征在于,包括如下步骤:
步骤1:数据采集,通过开发网络爬虫,以“化工文献”为主题对化学工程文献进行数据挖掘获取;
步骤2:文本预处理,对步骤1中的收集的文献数据集进行预处理,制定文献的预处理的样本以及文献的特征词的选定;
制定文献的预处理的样本的具体操作为:
1)设定相似度计算标准:①文献所要阐述的问题是否类似相近;②文献中背景技术及和涉及到技术领域是否相同;③文献中要解决问题是否相近;④文献中解决问题的方法是否相近或相似;
2)对文献特征词集合进行比对,如果两篇文献满足以上四种相似度计算标准的条件之一则判定为两篇文献是相似文献相似度为0.25,满足以上两条相似度则为0.5,满足三条则为0.75,满足四个条件则为1,反之为0;
步骤3:词嵌入层,将预处理好的文献作为输入,将文本材料转换为数字,嵌入层由令牌嵌入、位置嵌入、节段嵌入三部分组成输入的代表文本的向量集合;
步骤4:构建模型,构建编码器模块,每个编码器包括多头自注意力机制、残差连接归一化层、卷积层、池化层、残差连接归一化层,词向量进入到多头自注意力机制中进行提取文本特征,利用残差连接归一化层将其连接为原来规模大小的特征数据,将特征数据作为卷积层的输入设置多个一维不同宽度的卷积核,并进行卷积计算,得到不同宽度的词语之间的相关性;然后进入到池化层,将卷积层中的输出作平均池化操作,再将池化后的结果利用残差连接归一化层连接为原来规模大小的规模的特征向量;
多头注意力机制:
o
MultiHead(Q,K,V)=Concat(head1,head2,...,headh)W (式1)自注意力机制是对Q,K,V三个向量计算:
其中,Conncat()把haed1,head2,...,headh中的数据按字符串进行相加操作, 为q K v缩放因子,head为分割的头,输入词向量分别与随机初始化的w ,w ,w 矩阵相乘,此处3个q K vw,w,w都不相同,将输入的词向量由原来维度变为适合的维度,得到查询值Q,键值K,值V,oW为随机初始化矩阵用于做线性变换保证输入输出大小相同;
步骤5:在步骤4模型结构基础上进行深度学习的迭代训练,当训练收敛时,选择当前的模型作为最终模型,并对模型进行剪枝微调,具体为在每个编码器中的第二个LN层的缩放因子上加入L1正则化对权重参数做稀疏与特征选择;
L1正则化的公式为:
L1=∑(x,y)l(f(x,w),y)+λ∑y∈rg(g) (式7)引入一个尺度因子g,对应每个词嵌入的数字化表示,与每一个字embeding的输出相乘,然后联合训练权重和尺度因子,并对尺度因子稀疏正则化,最后修剪掉较小的尺度因子及其对应的权重;训练的损失函数如式7,其中加法第一项是正常的网络损失函数,后一项是尺度因子的正则化,g是尺度因子,λ是惩罚稀疏,最终LN进行如下的变换:其中,μβ和σβ是LN层上输入的均值和标准方差,g和b表示尺度和位移,zin、zout分别是LN层的输入和输出,ε是一个较小的正数,用于保证分母有意义,它提供了将归一化激活线性转换回任何尺度的可能性,将LN层中的g参数作为需要的缩放因子;
步骤6:将步骤5中两个并行的相同的模型进行并行输入得到两个输出a和b,使用DTW()进行相似度计算得到概率值,DTW()进行相似度计算为:DTW函数得出的数值为最短路径且大于1,在此处的应用为在训练阶段,模型处理好的文献为a与b,其中,a,b为数据特征,a到b的最短路径定义为w(w1,w2,...Wk),Wk表示w的第k个元素,表示了向量a和b之间的映射,提取a的特征后作为一个模板,存入模板库,再对b也同样提取特征,然后采用DTW算法与模板库中的a计算距离,求出最短距离也就是最大相似度,再次处进一步处理:d=min(a,b) (式5)其中,min(a,b)为a,b数据特征相加的最小值;
2.根据权利要求1所述的轻量化的化工文献相似度计算方法,其特征在于,所述步骤2中文献的特征词的选定具体操作为:
1)对文献的标题使用jieba分词器进行分词操作;
2)文献关键词不进行操作保留原样;
3)对文献的摘要先进行jieba分词操作,使用tf‑idf算法进行统计,其中tf为词频,idf为逆向文件频率,tf‑idf定义如下:tf‑idf=tf(d,w)*idf(t,d),tf(d,w)表示文档d中w的词频,idf(t,d)表示t个文献中有d个文献出现在了词语w;
4)经过计算后选取词汇集合中权重较高的x个特征词,并与标题分词后得到的词语和关键字进行合并,得到一个e个特征的样本集合{x1,x2,x3,...,xe}。
3.根据权利要求1所述的轻量化的化工文献相似度计算方法,其特征在于,如经过多头注意力机制层训练后的向量特征表示并没有得到提升,则嵌入层直接跳过多头注意力机制,执行残差连接归一化层操作。