利索能及
我要发布
收藏
专利号: 2022105896693
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于深度学习的新闻文本摘要生成方法,其特征在于,所述方法包括以下步骤:

1)通过爬虫算法爬取新闻网站上的新闻标题和新闻文本,每一个新闻文本和新闻标题组成一个story文件,文本与标题之间用@highlight标识符分隔;

2)将上述的story文件用Stanford CoreNLP工具包进行分句分词,通过贪婪算法,选择出新闻文本中与标题句子ROUGE‑1/2指标分数最高的前三个句子打上label标签,最后生成确定格式的标注文本作为训练数据和验证数据;

3)文本摘要生成方法使用的是抽取+生成的策略,先使用抽取式模型从新闻文本抽取出与标题相关度高的句子,然后将抽取出来的句子作为指导信号作用于另外一个生成式模型,去指导摘要的生成;

4)抽取式模型采用Bert网络模型获取句子表示,Inter‑sentence Transformer层作为摘要层,来对确定格式的标注文本作文本摘要抽取式的训练;同时,用另两个Bert网络模型作为两个编码器,解码器采用Transformer的Decoder端,对输入文本和指导信号进行文本摘要生成式的训练,指导信号是打上label的关键句子,实现过程如下:

4.1)给定token化的文本X=[cls,x1,x2,…,xn,sep]其中cls和sep是每个句子的句首和句尾插入的token,xt是文本t位置上的token,将文本X输入Bert模型后,得到文本的隐藏表示H=[h1,h2,……hm],获取每个句子句首的cls token的隐藏表示T=[T1,T2,…Tt];

4.2)将隐藏表示T传输给由两层Transformer Encoder layer组成的摘要层,输出得到lh ,然后经过一个sigmoid层,得到每个句子的分数Y=[y1,y2,…yn],根据标注文本的label标签L=[l1,l2,…ln],然后使用二分类交叉熵损失函数对抽取式模型进行训练:ln=‑[ln·logyn+(1‑ln)·log(1‑yn)]    (5)

其中l表示Transformer Encoder layer的层数,MHAtt是对Transformer Encoder l‑1layer层的输出h 做多头注意力运算, 是经过层归一化操作LN之后的输出,然后对该输l出做FFN前馈网络运算,生成第l层的输出向量h,σ是sigmoid运算,Wo是权重参数,bo是偏i差,y是第i个句子的预测分数,N是句子的个数,ln是第n个句子的标签,yn是第n个句子的预测分数;

4.3)将token化的输入文本X=[x1,x2,…,xn]与token化的指导信号G=[g1,g2,…,gm]分别输入给生成式模型的两个编码器Bert模型,分别得到隐藏表示Hx=[hx1,hx2,…,hxn],Hg=[hg1,hg2,…,hgm];

4.4)生成式模型的解码器端首先对上一层的输出y做一次self attention操作,其次利用Cross Attention机制关注指导信号并生成相应表示y1,然后再经过一个Cross Attention层,根据y1来处理整个输入文本,得到表示y2,最后经过一个前馈网络层,得到中间输出y3,经过6层Decoder layer之后,输出词的概率分布,计算损失,训练模型;

y=LN(y+Selfatt(y))    (6)

y1=LN(y+Crossatt(y,g))    (7)

y2=LN(y1+Crossatt(y1,x))    (8)

y3=LN(y2+FFN(y2))    (9)

其中,LN是层归一化操作,Selfatt是自注意力机制,Crossatt是交叉注意力机制,FFN是前馈网络运算,y是解码器端上一层的输出向量,g是指导信号的向量表示,x是输入文档的向量表示,y1是在y的基础上融合了指导信号g的向量表示,y2是在y1的基础上融合了输入的文档向量x的向量表示,y3是解码器端decoder层的输出;

5)训练完成后,将抽取式模型和生成式模型分别保存;

6)生成摘要时将一段新闻文本先输入到抽取式模型中,抽取出模型认为的候选摘要,然后将候选摘要和新闻文本再输入至生成式模型,得到最终的摘要。