1.一种基于N‑gram模型的弹幕主题提取方法,其特征在于,包括以下步骤:数据准备:提取弹幕数据;
构建弹幕特征:提取表示直播平台特色或符合联系方式特征的词语对应的特征,添加到自定义词库;将没有实际意义的词加入自定义停用词库;
数据预处理:去除“弹幕内容”字段为空的数据;去掉“弹幕内容”字段中的标点符号;
采用N‑gram模型将弹幕内容表示为词向量:经过数据预处理的弹幕内容,采用N‑gram模型来表示,N‑gram模型表示语句中某词的出现概率与之前N‑1个词相关,N为正整数;将每条弹幕内容切分成一组词向量,依据自定义词库中的成词规则来切分每条弹幕内容,根据自定义停用词库来过滤无用的词语;
所述N‑gram模型中,句子出现的概率公式为: 其
中,p表示句子出现的概率值,w1表示句子中第1个位置的词,Π表示累乘符号,m表示句子中的词个数,wi表示第i个词,m、i为正整数,p(wiwi‑1)表示第i和i‑1位置上的词同时出现的概率,将已有的词组按照该公式重新组合,利用相邻的两个单词合并生成新的词组。
2.如权利要求1所述的基于N‑gram模型的弹幕主题提取方法,其特征在于:所述N的取值为2,即每个词与它前面一个词有关系。
3.如权利要求1所述的基于N‑gram模型的弹幕主题提取方法,其特征在于:所述词向量的维度为60万维,即将每一条弹幕内容表示为60万维的一个向量,每个位置对应一个词,得到最终的弹幕主题表示。
4.一种存储介质,该存储介质上存储有计算机程序,其特征在于:所述计算机程序被处理器执行时实现权利要求1至3任一项所述的方法。
5.一种电子设备,包括存储器和处理器,存储器上储存有在处理器上运行的计算机程序,其特征在于:处理器执行计算机程序时实现权利要求1至3任一项所述的方法。
6.一种基于N‑gram模型的弹幕主题提取系统,其特征在于:该系统包括数据准备单元、弹幕特征构建单元、数据预处理单元、N‑gram模型表示单元、切分单元,其中:数据准备单元用于:提取弹幕数据;
弹幕特征构建单元用于:提取表示直播平台特色或符合联系方式特征的词语对应的特征,添加到自定义词库;将没有实际意义的词加入自定义停用词库;
数据预处理单元用于:去除“弹幕内容”字段为空的数据;去掉“弹幕内容”字段中的标点符号;
N‑gram模型表示单元用于:经过数据预处理的弹幕内容,采用N‑gram模型来表示,N‑gram模型表示语句中某词的出现概率与之前N‑1个词相关,N为正整数;
切分单元用于:将每条弹幕内容切分成一组词向量,依据自定义词库中的成词规则来切分每条弹幕内容,根据自定义停用词库来过滤无用的词语;
所述N‑gram模型中,句子出现的概率公式为: 其
中,p表示句子出现的概率值,w1表示句子中第1个位置的词,Π表示累乘符号,m表示句子中的词个数,wi表示第i个词,m、i为正整数,p(wiwi‑1)表示第i和i‑1位置上的词同时出现的概率,将已有的词组按照该公式重新组合,利用相邻的两个单词合并生成新的词组。
7.如权利要求6所述的基于N‑gram模型的弹幕主题提取系统,其特征在于:所述N的取值为2,即每个词与它前面一个词有关系。
8.如权利要求6所述的基于N‑gram模型的弹幕主题提取系统,其特征在于:所述词向量的维度为60万维,即将每一条弹幕内容表示为60万维的一个向量,每个位置对应一个词,得到最终的弹幕主题表示。