利索能及
我要发布
收藏
专利号: 202210608472X
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于深度学习的中文文本语义压缩方法,其特征在于,所述方法包括以下步骤:

1)首先对输入文本进行预处理,操作如下:将所要传输的句子s标准化为词数个数为n,参数n可以自行设定;然后利用Jieba中文分词工具进行去除停用词以及分词处理,得到w1,w2,w3,···,wn,接着运用Word2Vec中文预训练模型输出每一个单词w1,w2,w3,···,wn所对应的词向量,用c1,c2,c3,···,cn表示,词向量组c1,c2,c3,···,cn记作C;

2)将词向量组c1,c2,c3,···,cn输入至编码器,编码器共有相同两层,在编码器第一层中,词向量组首先进入自注意力机制,计算过程如下:i q

q=W×C, i∈[1,n]                    (1)i k

k=W×C                         (2)i v

v=W×C                         (3)q k v

其中,W ,W ,W为维数为256的可训练参数方阵;

i i 1

3)对于每一个q ,i∈[1,n],都令其与每一个k进行向量点乘运算,i∈[1,n],对于q 分别得到α1,1,α1,2,α1,3,···,α1,n,将α1,1,α1,2,α1,3,···,α1,n进行Softmax归一化操作,得到 其中:

1 2 3 n

再将 分别与各自对应的v ,v ,v ,···,v相乘,将所得结果累加得到

1 1 2 3 n

向量a;将上述操作进行n次,得到向量a ,a ,a ,···,a,公式如下:至此,完成第一次自注意力机制操作;将自注意力机制操作生成的向量称为注意力向

1 2 3 n

量,即a ,a ,a ,···,a;

1 2 3 n

4)将注意力向量a ,a ,a ,···,a 分别输入双向长短期记忆神经网络Bi‑LSTM层,分

1 2 3 n 1 2 3 n

别得到向量b ,b ,b ,···,b,维数与a ,a ,a ,···,a相同;

1 2 3 n

5)向量b ,b ,b ,···,b 进入编码器第二层,首先重复进行第一层中的自注意力操

1 2 3 n

作,输出的注意力向量再经过双向长短期记忆神经网络输出向量组e ,e ,e ,···,e,将

1 2 3 n

e ,e ,e ,···,e分别乘以维数为256的可训练参数方阵 分别得到向量 i∈[1,n];

6)进入解码器部分,解码器共有相同两层,第一层中,首先将由一个维数为256的初始词向量输入至解码器开始进行解码操作;

7)由第一个目标单词词向量作为解码器第二次解码的输入,同理将第一个目标单词的q k v词向量乘以维数为256的方阵 得到对应向量n ,n ,n保留以进行后续操作;

8)第二个目标单词作为解码器第三次解码的输入,后续重复上述解码操作步骤,直至输出所有目标单词,从而得到预测语义

9)通过最小化负对数损失函数来训练模型参数,模型参数包括矩阵元素与神经网络权重;

所述步骤6)中,初始词向量将进行自注意力机制操作,所得注意力向量记为m;下一步进入Decoder‑Encoder Attention层进行注意力机制操作,过程如下:将向量m乘以维m m数为256的方阵 得到向量q,将向量q分别与向量 进行点乘操作,i∈[1,n],得到i∈[1,n],公式如下:i m

其中, 为向量e与方阵 相乘所得向量,q为向量m与方阵 相乘所得向量;

对 进行Softmax归一化操作得到 i∈[1,n],再将 分别与各自对应的 相乘,i∈

1 1

[1,n],所得结果相加得到注意力向量r,向量r再经过前馈神经网络FFNN层得到向量 向量 进入解码器第二层,第二层中重复第一层的操作,最后经过Softmax层输出概率向量,概率值最大的维度对应为第一个目标单词。

2.如权利要求1所述的一种基于深度学习的中文文本语义压缩方法,其特征在于,所述q k v步骤7)中,第二次解码操作说明如下:将向量n ,n ,n 与初始词向量进行自注意力机制操作,得到第一个目标单词词向量对应的注意力向量h,将h乘以维数为256的可训练参数方阵h h i得到向量q,将向量q分别与向量 进行点乘操作,i∈[1,n],得到γ ,i∈[1,n],公式如下:i h

其中, 为向量e与方阵 相乘所得向量,q 为注意力向量h与方阵 相乘所得向量;

i

再对γ 进行Softmax归一化操作得到 i∈[1,n],将 分别与各自对应的 相乘,i∈

2 2

[1,n],所得结果相加得到注意力向量r,向量r在经过前馈神经网络FFNN层得到向量 向量 进入解码器第二层,第二层中重复第一层的操作,最后经过Softmax层输出概率向量,概率最大的对应为第二个目标单词。

3.如权利要求1所述的一种基于深度学习的中文文本语义压缩方法,其特征在于,所述步骤9)中,损失函数定义为:其中, 为在t时刻解码器生成标准语义句中词语 的概率,T为解码器生成语义句子所需要的总时间。