利索能及
我要发布
收藏
专利号: 2023115245443
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于互信息和对抗神经网络的增强主题多样性方法,其特征在于:所述增强主题多样性方法包括如下步骤:步骤1、对社交平台在线文本进行数据预处理获得真实文本,将真实文本使用词袋模型表示成真实文本‑词分布向量;

步骤2、将步骤1中的多个所述真实文本‑词分布向量放在同一个批次中作为编码器的输入,得到真实文本‑主题分布向量,将真实文本‑词分布向量与对应的主题分布构成真实分布对,再将真实文本‑词分布向量批内打乱与真实文本‑主题分布向量拼接构成负样本分布对;

步骤3、从狄利克雷分布随机采样出主题向量作为假文本‑主题分布并输入生成器中,得到假文本‑词分布向量,假文本‑词分布向量与假文本‑主题分布构成假分布对;

步骤4、判别器接收步骤2得到的真实分布对和步骤3生成的假分布对作为判别器输入,计算两者的损失,来区分真实数据分布对和生成数据分布对,引入统计网络,所述统计网络接收真实分布对和负样本分布对作为输入,计算它们之间的互信息,互信息的正则化损失被添加到判别器的损失中;

步骤5、训练中使用对抗训练来近似估计真实分布对和假分布对之间的推土机距离与真实分布对和负样本分布对之间的詹森香农距离,通过对抗训练的优化目标和迭代模型,直至损失函数收敛,具体包括如下步骤:步骤5‑1、加载数据集包括文本数据、词汇表和词向量;

步骤5‑2、构建编码器E、生成器G、判别器D、统计网络H模型,并构建优化器对模型进行优化;

步骤5‑3、将真实分布对 和假分布对 作为判别器D输入,在对抗训练过程中,其输出信号Dout指导编码器E与生成器G的学习进而挖掘出文本中的主题;

步骤5‑4、统计网络H利用真实样本对 和负样本分布对 为输入来估计文本‑词分布与文本主题分布空间之间的互信息并将其最大化以提升主题多样性;

步骤5‑5、根据判别器的损失函数和正则化互信息损失函数进行随机梯度下降优化,更新编码器和解码器的参数,即:步骤5‑6、重复步骤5‑3至步骤5‑5,直至收敛。

2.根据权利要求1所述的一种基于互信息和对抗神经网络的增强主题多样性方法,其特征在于:步骤2中的编码器E训练真实文本‑词分布向量到真实文本‑主题分布向量的映射关系,包括V维文本‑词分布层、S维语义‑隐含表示层和K维文本‑主题分布层,具体包括步骤:步骤2‑1、以步骤1中真实文本使用词袋模型表示,进行随机采样得到V维文本‑词分布表示 作为输入,编码器E将其映射到S维隐含语义空间,再将得到的S维隐含语义空间映射到K维文本‑主题分布层,采用如下公式得到:其中, 和 为文本‑词分布层到语义‑隐含表示层的权重矩阵,为文本‑词分布层到语义‑隐含表示层的权重矩阵的偏置项,LR为LeakyReLU激活函数的参数,BN(·)为批归一化, 为语义‑隐含表示层到文本‑主题分布层的权重矩阵, 为语义‑隐含表示层到文本‑主题分布层的偏置项目, 是真实文本对应的文本‑主题分布且第k∈{1,

2,…,K}维 表示第k个主题在真实文本中所占的比重;

步骤2‑2、随后将真实V维词分布向量与真实K维主题分布向量拼接为真实分布对将批内打乱的真实文本‑词分布向量表示为 将批内不匹配的主题分布与词分布构成负样本分布对

3.根据权利要求2所述的一种基于互信息和对抗神经网络的增强主题多样性方法,其特征在于:步骤3中生成器G生成一个文本‑主题分布到文本‑词分布的映射关系,包括K维文本‑主题分布层、S维语义‑隐含表示层和V维文本‑词分布层,使用参数为 的狄利克雷分布作为假文本‑主题分布 的先验,采用如下公式得到:其中,参数 为狄利克雷分布的概率密度,主题k为增强主题多样性方法的主题参数,表示文本中每个词属于每个主题的概率;

步骤3‑1、生成器G利用如下变换先将假文本‑主题分布 转换到S维语义‑隐含表示层,再将得到的S维隐含语义空间映射到V维文本‑词分布层:其中, 为文本‑主题分布层到语义‑隐含表示层的权重矩阵, 为文本‑主题分布层到语义‑隐含表示层的偏置项,LR为LeakyReLU激活函数的参数,BN(·)为批归一化,是语义‑隐含表示层到文本‑词分布层的权重矩阵, 是语义‑隐含表示层到文本‑词分布层的偏置项目, 是真实文本对应的文本‑主题分布且第k∈{1,2,…,K}维 表示第k个主题在真实文本中所占的比重;

步骤3‑2、随即将假文本‑主题分布 与假文本‑词分布 拼接成假分布对

4.根据权利要求3所述的一种基于互信息和对抗神经网络的增强主题多样性方法,其特征在于:步骤4中真实分布对 和假分布对 视为由两个K+V维联合分布对 和 中采样出来的随机样本,其中 和 均为由一个K维狄利克雷分布对和一个V维狄利克雷分布对构成的联合分布,判别器D训练目标是让假分布 逼近真实分布对 统计网络H利用真实分布对 和负样本分布对 估计文本‑词分布空间与文本‑主题分布空间之间的互信息并将其最大化提升主题多样性,当训练完成时编码器E和生成器G便得到文本‑主题分布与文本‑词分布之间的双向映射关系和内在互信息最大化关系,具体包括如下步骤步骤4‑1、判别器E由三层全连接网络构成,三层全连接网络具体为一个V+K维的联合分布层,一个S维的语义‑隐含表示层,一个输出层,以真实分布对 与假分布对 为输入并输出Dout来判断输入分布对的真假,该方法采用如下公式:其中,W为推土机距离,D(·)为判别器的输出信号,接近1的值表示判别器更倾向于将其判别为真,反之为假;

步骤4‑2、统计网络H包含全局判别器D′和最大化互信息损失函数,全局判别器D′包括一个V+K维的联合分布层、一个S维的语义‑隐含表示层和一个输出层,所述统计网络H用来计算真实样本对 与负样本对 之间的互信息并输出Sout,该方法采用如下公式:softplus=log(1+erp(x))

其中,sp(·)表示softplus激活函数,x表示激活函数的输入, 和 分别表示文本‑词分布层的真实数据分布和文本‑主题分布层的真实分布, 是同一批中与 不匹配的真实文本‑词分布;

步骤4‑3、模型最终训练目标如下: