利索能及
我要发布
收藏
专利号: 2019105838944
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种面向客服在线质检的文本分类方法,其特征在于,所述方法包括下列步骤步骤1.数据准备及预处理,过程如下:

1.1语音转文本

需要分类的数据来自在线客服与客户的交流,将语音数据转译成文本数据;

1.2数据标注

1.3数据预处理

步骤2.特征表示,采用两种可选择的特征表示方案,如下:

2.1 one‑hot或word2vec+位置编码得到词对应的one‑hot特征向量wi之后,将wi加上对应位置的位置编码向量pi得到新的词向量w′i,位置编码向量的计算采用正余弦位置编码公式计算:

2i/d

PE(pos,2i)=sin(pos/10000 )

2i/d

PE(pos,2i+1)=cos(pos/10000 )为了使得位置编码向量与one‑hot编码的词向量相加,两者的维度必须相同,并且不能直接将w′i相加得到对应的文本向量,使用嵌入的方式得到对应的句向量,只需要在对应的分类模型中的输入层加上一层嵌入层即可;

若应用场景下的数据量足够多,使用word2vec训练得到词向量来取代简单的one‑hot表示;

2.2 n‑gram

采用累加的方式得到对应的文本向量,不需要训练额外的嵌入层,但是其能够考虑的顺序关系距离受n限制,而且n的取值越大会使得到的特征向量越稀疏;

步骤3.分类模型,结合选用的特征表示方法构建不同的分类模型,过程如下:

3.1 one‑hot或word2vec+位置编码+starspace;

S1)输入层:输入层有两个通道,分别对应文本实体的嵌入和类别实体的嵌入,结合特征表示阶段构建的结合了位置编码的词向量,在经过一层嵌入层之后,得到对应文本的特征向量作为文本实体通道的输入,将所有的类别实体用one‑hot表示,每一维对应一个类别,从而得到相应的实体向量表示作为实体嵌入通道的输入;

S2)隐藏层:两层简单的神经网络层,参数根据具体应用调节;

S3)输出层:输出文本实体的嵌入向量和类别实体的嵌入向量;

3.2 n‑gram+CNN,构建步骤如下:S1)构建n‑gram特征向量,向量的每一维对应一个n元词组,S2)对每一条文本,即n元词组序列,其文本的特征矩阵作为CNN模型的输入,每一个n元词组对应一个向量;

S3)设置响应的卷积核大小和数量,每个卷积核在文本特征矩阵上单方向移动,每次移动都通过矩阵计算得到对应位置的特征,直至提取完整条文本的特征,最后得到对应的特征向量;

S4)抛弃池化过程,因为在池化过程中会丢失一些位置信息,直接经过softmax层输出分类结果。

2.如权利要求1所述的一种面向客服在线质检的文本分类方法,其特征在于,所述1.3中,数据预处理的步骤如下:

S1)计算tf,统计每条文本中出现的词以及对应的词频;

S2)计算idf,统计所有语料中出现的词,对于每一个词,计算其出现过的文本数;

S3)对于每条文本,计算改文本中出现词的tf‑idf=tf*idf;

S4)对于每条文本,去除掉tf‑idf低于阈值k的词,k作为超参数其值的选取可根据具体任务调节。