利索能及
我要发布
收藏
专利号: 2018104217449
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于特征多样化的卷积神经网络的情感分析模型构建方法,其特征在于,包括以下步骤:步骤1)输入情感单词数据集作为情感分析任务中的情感词集合,并在情感单词数据集中加入新兴社交网络词语,以此作为构建该模型所使用的情感词典,并输入带有标记的句子语料作为训练数据集;

步骤2)分褒贬两类统计计算情感词典中的不同情感词在褒贬两类极性数据集上出现的次数并计算该情感词的情感得分;

步骤3)使用相同维度的向量来表示情感词的情感得分和普通词条的权重得分,得到卷积神经网络需要的一次性接收文本的平行化输入,将每一个情感得分值用一个多维的连续值向量来表示,将每一个普通词条的权重得分映射为一个维度一样的多维连续值向量;

步骤4)以词为单位将语料训练数据集中的不同句子表示为一个由词向量组成的二维矩阵,对于句子中的每一个词条,将词条映射为一个随数据集大小改变的m维的连续值向量;在卷积神经网络输入层,使用拼接和矩阵运算两种不同的矩阵计算方式验证卷积神经网络的有效性;

步骤5)在数据集上训练一个卷积神经网络,卷积神经网络中使用多窗口、多卷积核对输入句子进行卷积操作,所述卷积神经网络包括卷积层,池化层,全连接层和一个softmax模型的输出层,线性整流函数即ReLU函数作为激活函数,并使用了dropout机制和权重的正则化限制训练模型,最小化交叉熵优化模型。

2.根据权利要求1所述的一种基于特征多样化的卷积神经网络的情感分析模型构建方法,其特征在于,所述步骤2)具体如下:步骤21)情感词典中出现的每一个情感词,计算情感词在不同极性数据集上出现的次数来计算情感得分,如公式(1)、(2)所示:式(1)中| |为去绝对值操作符号,式(2)中 为向下取整操作,式(1)和式(2)中senti为情感词典中的第i个情感词, 为包含情感词senti的积极情感数据集样本个数,为包含情感词senti的消极情感数据集样本个数,Freq(senti)为情感词senti在数据集上重要程度表示;Freqmin为最小文档频数,Freqmax为最大文档频数,Score(senti)为包含情感词senti的情感得分,α,β,θ为可调参数,α和β用来调整不同极性数据集文档频数的重要程度,θ控制情感得分的阈值,i是序号;

步骤22)将每个情感词映射为一个对应的整数值:

式(3)中 为包含词条wi的积极情感数据集样本个数, 为包含词条wi的消极情感数据集样本个数,Weight(wi)为普通词条wi的权重得分。

3.根据权利要求1所述的一种基于特征多样化的卷积神经网络的情感分析模型构建方法,其特征在于,所述步骤3)具体如下:步骤31)用相同维度的向量来表示情感词的情感得分和普通词条的权重得分,模型将每一个得分值都用一个多维的连续值向量来表示,如公式(4)所示:esi=[e1,e2,…,ep]                            (4)式(4)中 为情感词得分为i的向量表示, 表示esi在实数域中取值,情感数据集中的情感词得分向量集合为 |Score|为式(2)中情感词情感得分集合大小;

步骤32)对于每一个普通词条的权重得分,将权重得分映射为一个维度相同的多维连续值向量,如公式(5)所示:ewi=[e1,e2,…,ep]              (5)式(5)中 为情感词得分为i的向量表示, 表示ewi在实数域中取值,情感数据集中的情感词得分向量集合为 |weight|为式(3)中情感词情感得分集合大小。

4.根据权利要求1所述的一种基于特征多样化的卷积神经网络的情感分析模型构建方法,其特征在于,所述步骤4)具体如下:步骤41)句子语料作为训练数据集中长度为n的句子s={w1,w2,…,wn},其中wi为句子中第i个词条,以词为单位将句子表示为一个由词向量组成的二维矩阵,如公式(6)所示:e1:n=e1⊕e2⊕…⊕en                  (6)式(6)中⊕为拼接操作 表示e1:n在实数域中取值,m为词向量维度,ei为词条wi的词向量,将每一个词条映射为一个m维的连续值向量;

步骤42)采用拼接方式形成网络词语的向量表示,由步骤41中得到的词条,当该词为情感词,向量的计算方式如公式(7)所示,当词为普通词语,计算方式如公式(8)所示:xi=ei⊕esi                                (7)xi=ei⊕ewi                                (8)步骤43)使用一个权重矩阵来控制特征向量和词向量的输入,如公式(9)、(10)所示:xi=ei+R⊙esi                              (9)xi=ei+R⊙ewi                             (10)式(9)和式(10)中 为可调权重矩阵,R表示控制特征向量的分量输入,⊙为矩阵相乘。

5.根据权利要求1所述的一种基于特征多样化的卷积神经网络的情感分析模型构建方法,其特征在于,所述步骤5)具体如下:步骤51)卷积神经网络接收句子的平行化输入,对长度为h的卷积窗口,卷积神经网络通过卷积核对输入矩阵x1:n进行卷积操作,如公式(11)所示:ci=f(w·xi:i+h-1+b)                          (11)式(11)中 为卷积核权重, 表示w在实数域中取值,d表示xi维度, 为偏置,f为激活函数,xi:i+h-1为一个卷积窗口的词向量矩阵;长度为n的句子,通过卷积操作可得到如公式(12)所示的卷积后特征向量,c=[c1,c2,…,cn-h+1]                           (12)步骤52)从每一个特征向量中提取一个最大的值,有m个卷积核的窗口可以得到如式(13)所示特征向量:式(13)中 为卷积神经网络提取得到的特征向量,∧表示取最大值;

步骤53)通过一个softmax函数输出分类结果,如公式(14)、(15)所示y=softmax(W·X+b)                          (14)其中 为下采样层输出的正则项限制,为对应元素相乘, 为全连接层

权重矩阵, 为全连接层偏置,通过最小化交叉熵来优化模型,交叉熵代价函数如公式(16)所示:式(16)中D为训练集数据集合,C为数据的类别集合,yi为待分类句子i的预测类别, 为待分类句子i实际类别,λ||θ||2为交叉熵正则项,j是序号。

6.根据权利要求2所述的一种基于特征多样化的卷积神经网络的情感分析模型构建方法,其特征在于,所述步骤21)中,α,β按照经验各取1.2,θ按照经验取200。

7.根据权利要求3所述的一种基于特征多样化的卷积神经网络的情感分析模型构建方法,其特征在于,所述步骤31)中,特征向量维度按照经验取值为100。

8.根据权利要求5所述的一种基于特征多样化的卷积神经网络的情感分析模型构建方法,其特征在于,所述步骤51)中,其中窗口大小照经验分别为2、3、4、5,每种窗口的卷积核个数照经验均取100,为f激活函数ReLU,形如:f(x)=max(x,0)的函数。

9.根据权利要求5所述的一种基于特征多样化的卷积神经网络的情感分析模型构建方法,其特征在于,所述步骤53)中,softmax函数为 即原始神经网络的输出为y={y1,y2,...,yn},n为向量长度,i为遍历取值,∑为求和函数,这个函数作用是让原始神经网络输出符合概率分布,下采样层处理可以忽略目标的斜、旋转之类的相对位置的变化,提高分类精度,同时降低了特征图的维度并且已定成度上可以避免过拟合;全连接层的含义指的是相邻两层之间的任意两个节点之间都有连接,用于对输入的特征做加权和运算。

10.根据权利要求5所述的一种基于特征多样化的卷积神经网络的情感分析模型构建方法,其特征在于,所述步骤53)中,权重限制按照经验最大值为3,Dropout按照经验为0.5,Mini-batch按照经验为32。