1.一种面向热点话题的基于自监督表示学习的观点挖掘方法,其特征在于:所述观点挖掘方法包括以下步骤:步骤1、对获取到的社交媒体评论文本进行数据预处理,根据词袋模型得到文档采用TF‑IDF表示法的词袋模型表示步骤2、将步骤1中得到的词袋模型表示 进行数据增强,以获得成对的相似文档向量表示步骤3、将步骤2获得的增强后的成对的相似文档向量表示 作为编码器网络的输入,得到编码器网络的输出,该输出表示为输入文档的观点分布的向量表示;
步骤4、通过最小化编码器网络输出的不变性、方差、协方差正则化损失和狄利克雷先验分布对齐的先验损失,约束模型的参数变化,不断迭代至损失函数收敛,以确保模型的稳定性和观点挖掘的准确性,其中,通过最小化编码器网络输出的不变性、方差、协方差正则化损失和狄利克雷先验分布对齐的先验损失,具体包括如下步骤:步骤4.1、对于增强后成对的相似文档向量表示 经过映射后是相似的,计算不变性正则化损失进行约束,给定推断出来的观点分布 和 损失的计算方式如下:
其中,M表示批次大小,i为上式中求和过程对成对的相似文档向量表示的遍历索引,和 表示成对的相似文档向量表示 的成对观点分布;
步骤4.2、为防止观点映射出现同一性,使用方差损失函数解决模型坍塌问题,计算方式如下:其中, 是由观点分布Θa中所有观点分布中第k维上的
每个值组成的向量,∈是为了数据稳定性的微小标量,K表示文档观点数, 表示一般性数据;
步骤4.3、利用协方差损失进行约束,计算方式如下:
其中, j表示矩阵中第j列,T表示矩阵转置运算;
步骤4.4、综合步骤4.1、步骤4.2和步骤4.3计算公式得到三项正则化损失为:其中,λ,μ,η是不同的超参数;
步骤4.5、通过计算推断得到的文档观点分布和狄利克雷先验分布的最大平均偏差,来约束编码器网络的输出分布。
2.根据权利要求1所述的一种面向热点话题的基于自监督表示学习的观点挖掘方法,其特征在于:所述步骤1具体包括以下步骤:步骤1‑1、数据预处理:从社交媒体平台收集公众评论的内容结构,解析收集内容中有意义的评论实体,去除不符合语言类别要求的文本、对文本的单词进行词形还原和拼写检查、移除文本中的停用词、筛选出小于设定的文档长度阈值的文本并剔除;
步骤1‑2、文档表示的获取:对于一篇文档中的一个单词t,计算单词t在文档d中的出现次数与文档d中所有单词的总数之比,即单词t在文档中出现的词频TF(t,d),计算该词对于整个语料库的重要性即逆文档频率IDF(t,D),将语料库中文档总数与包含单词t的文档总数自增一之后的比值取对数,该单词在此文档和语料库中的TF‑IDF权重的计算方式为词频TF(t,d)和逆文档频率IDF(t,D)的乘积,对于给定文档,得到一个由所有单词t其对应的TF‑IDF权重构成的词袋模型表示
3.根据权利要求1所述的一种面向热点话题的基于自监督表示学习的观点挖掘方法,其特征在于:步骤2中对步骤1中得到的词袋模型表示 进行数据增强具体为:假定词袋模型表示 是V维向量,向量维数V与语料的词表大小相等,设定概率p,并得到向量中L个数值上最小的单词表示,对于词袋模型表示 的数据增强根据随机概率性选择如下三种数据增强方式:a)以概率p减少单词t数值的q%;
b)以概率p增加单词t数值的q%;
c)以概率p将单词的t数值置为零。
4.根据权利要求1所述的一种面向热点话题的基于自监督表示学习的观点挖掘方法,其特征在于:所述步骤3中的编码器网络利用如下的全连接层变换,增强后的成对的相似文档向量表示 作为输入,推断出文本的观点表示,具体实现步骤包括:步骤3.1、从步骤2得到的语料中进行随机采样,得到V维成对的相似文档向量表示输入编码器网络,经过如下两层线性变换映射到S维隐含语义空间:其中, 表示一层的权重矩阵, 是表示二层的权重矩阵, 和 是偏置项, 和 表示层的隐状态, 和 表示层激活后的表示向量,SN(·)是谱归一化,Hardswish(·)是激活函数;
步骤3.2、将步骤3.1中的表示向量 经过全连接层变换,将其映射为K维的文档观点分布:其中, 和 是此层的权重矩阵和偏置项, 是文档观点分布层的隐状态,为成对的相似文档向量表示 对应的K维文档观点分布,且第k∈{1,2,..,K}多项式分布 表示第k个观点在成对的相似文档向量表示 所占的比重。
5.根据权利要求1所述的一种面向热点话题的基于自监督表示学习的观点挖掘方法,其特征在于:所述步骤4.5通过计算推断得到的文档观点分布和狄利克雷先验分布的最大平均偏差,来约束编码器网络的输出分布,具体包括如下步骤:步骤4.5.1、给定推断的观点分布集合 从参数为 的狄利克雷分布中进行随机采样,获得Θ的先验分布 具体使用的公式如下:
其中,k为此模型训练所使用的观点数设置, 是由服从参数为 的狄利克雷分布中采样出来的先验样本,αi是参数向量 的第i个数值;
步骤4.5.2、在获得观点分布集合Θ和先验分布Θ′后,利用如下公式计算出两个分布之间的最大平均偏差:其中,κ表示核函数,n=2M, 和 为编码器编码得到的观点分布, 和 为从先验分布中采样得到的观点分布;
根据如上计算公式,得到模型训练的全部损失为:
其中β为模型训练中使用的超参, 为使用最大平均偏差距离计算所得先验匹配损失。
6.根据权利要求1所述的一种面向热点话题的基于自监督表示学习的观点挖掘方法,其特征在于:所述步骤4中约束模型的参数变化,不断迭代至损失函数收敛,其中模型训练具体流程如下:步骤4.2.1、构建编码器网络,使用优化器对模型进行优化,指定模型的超参数λ,μ,η,β,其中超参数λ,μ,η,β的值大于零;
步骤4.2.2、从语料库中随机采样输入编码器网络,从服从参数为 的狄利克雷分布中采样得到先验分布,从编码器网络输出中采样得到文本的观点分布;
步骤4.2.3、通过优化上述三项正则化损失和狄利克雷先验匹配损失进行随机梯度下降,进而更新编码器网络的参数;
步骤4.2.4、重复步骤4.2.2和步骤4.2.3,直至模型收敛。