1.一种基于深度学习的中文文本语义压缩方法,其特征在于,所述方法包括以下步骤:
1)首先对输入文本进行预处理,操作如下:将所要传输的句子s标准化为词数个数为n,参数n可以自行设定;然后利用Jieba中文分词工具进行去除停用词以及分词处理,得到w1,w2,w3,···,wn,接着运用Word2Vec中文预训练模型输出每一个单词w1,w2,w3,···,wn所对应的词向量,用c1,c2,c3,···,cn表示,词向量组c1,c2,c3,···,cn记作C;
2)将词向量组c1,c2,c3,···,cn输入至编码器,编码器共有相同两层,在编码器第一层中,词向量组首先进入自注意力机制,计算过程如下:i q
q=W×C, i∈[1,n] (1)i k
k=W×C (2)i v
v=W×C (3)q k v
其中,W ,W ,W为维数为256的可训练参数方阵;
i i 1
3)对于每一个q ,i∈[1,n],都令其与每一个k进行向量点乘运算,i∈[1,n],对于q 分别得到α1,1,α1,2,α1,3,···,α1,n,将α1,1,α1,2,α1,3,···,α1,n进行Softmax归一化操作,得到 其中:
1 2 3 n
再将 分别与各自对应的v ,v ,v ,···,v相乘,将所得结果累加得到
1 1 2 3 n
向量a;将上述操作进行n次,得到向量a ,a ,a ,···,a,公式如下:至此,完成第一次自注意力机制操作;将自注意力机制操作生成的向量称为注意力向
1 2 3 n
量,即a ,a ,a ,···,a;
1 2 3 n
4)将注意力向量a ,a ,a ,···,a 分别输入双向长短期记忆神经网络Bi‑LSTM层,分
1 2 3 n 1 2 3 n
别得到向量b ,b ,b ,···,b,维数与a ,a ,a ,···,a相同;
1 2 3 n
5)向量b ,b ,b ,···,b 进入编码器第二层,首先重复进行第一层中的自注意力操
1 2 3 n
作,输出的注意力向量再经过双向长短期记忆神经网络输出向量组e ,e ,e ,···,e,将
1 2 3 n
e ,e ,e ,···,e分别乘以维数为256的可训练参数方阵 分别得到向量 i∈[1,n];
6)进入解码器部分,解码器共有相同两层,第一层中,首先将由一个维数为256的初始词向量
7)由第一个目标单词词向量作为解码器第二次解码的输入,同理将第一个目标单词的q k v词向量乘以维数为256的方阵 得到对应向量n ,n ,n保留以进行后续操作;
8)第二个目标单词作为解码器第三次解码的输入,后续重复上述解码操作步骤,直至输出所有目标单词,从而得到预测语义
9)通过最小化负对数损失函数来训练模型参数,模型参数包括矩阵元素与神经网络权重;
所述步骤6)中,初始词向量
其中, 为向量e与方阵 相乘所得向量,q为向量m与方阵 相乘所得向量;
对 进行Softmax归一化操作得到 i∈[1,n],再将 分别与各自对应的 相乘,i∈
1 1
[1,n],所得结果相加得到注意力向量r,向量r再经过前馈神经网络FFNN层得到向量 向量 进入解码器第二层,第二层中重复第一层的操作,最后经过Softmax层输出概率向量,概率值最大的维度对应为第一个目标单词。
2.如权利要求1所述的一种基于深度学习的中文文本语义压缩方法,其特征在于,所述q k v步骤7)中,第二次解码操作说明如下:将向量n ,n ,n 与初始词向量进行自注意力机制操作,得到第一个目标单词词向量对应的注意力向量h,将h乘以维数为256的可训练参数方阵h h i得到向量q,将向量q分别与向量 进行点乘操作,i∈[1,n],得到γ ,i∈[1,n],公式如下:i h
其中, 为向量e与方阵 相乘所得向量,q 为注意力向量h与方阵 相乘所得向量;
i
再对γ 进行Softmax归一化操作得到 i∈[1,n],将 分别与各自对应的 相乘,i∈
2 2
[1,n],所得结果相加得到注意力向量r,向量r在经过前馈神经网络FFNN层得到向量 向量 进入解码器第二层,第二层中重复第一层的操作,最后经过Softmax层输出概率向量,概率最大的对应为第二个目标单词。
3.如权利要求1所述的一种基于深度学习的中文文本语义压缩方法,其特征在于,所述步骤9)中,损失函数定义为:其中, 为在t时刻解码器生成标准语义句中词语 的概率,T为解码器生成语义句子所需要的总时间。