1.一种基于长尾问题的多标签文本分类方法,其特征在于,构建包括文本语义提取模块、权重转移模块、融合模块以及分类模块的文本分类模型,进行分类的过程包括以下步骤:S1、文本语义提取模块通过Bert、BILSTM以及注意力机制对头部标签和尾部标签进行文本语义提取,分别获得头部标签文本表示和尾部标签文本表示;
S2、对头部标签文本表示和尾部标签文本表示分别进行采样,得到头部标签原型和尾部标签原型;
S3、利用头部标签文本表示对头部标签分类器进行训练,获取头部标签分类器,通过最小化头部标签分类器的损失函数,得到头部标签权重;
S4、权重转移模块将头部标签原型映射到头部标签权重上,并通过最小化迁移学习获取转移权重;
S4、权重转移模块根据转移权重对头部标签权重进行转移,得到尾部标签分类器;
S5、融合模块将尾部标签分类器和头部标签分类器进行融合,得到分类模块;
S6、将待分类数据的文本表示输入分类模块,得到分类结果。
2.根据权利要求1所述的一种基于长尾问题的多标签文本分类方法,其特征在于,获取文本表示的过程包括:采用Bert模型对文本进行预训练,得到预训练文本表示;
通过BILSTM获取预训练文本表示的文本上下文依赖关系;
利用注意力机制对文本上下文依赖关系进行强化,得到文本表示。
3.根据权利要求2所述的一种基于长尾问题的多标签文本分类方法,其特征在于,文本通过Bert进行预训练,输出结果为{V1,V2,...,Vp,...,Vn},n代表最大单词长度,Vp为第p个单词对应的文本嵌入向量;采用的Bert维度为768维,多头注意力机制个数是12个,Transformer层数是12层。
4.根据权利要求3所述的一种基于长尾问题的多标签文本分类方法,其特征在于,通过BILSTM获取预训练文本表示的文本上下文依赖关系包括:
2k×n
其中,Vp为第p个单词对应的文本嵌入向量;H为文本上下文依赖关系,H∈R ,为前向文本上下文依赖关系,为后向文本上下文依赖关系, 表示在p处的前向隐状态, 表示在p处的后向隐状态。
5.根据权利要求4所述的一种基于长尾问题的多标签文本分类方法,其特征在于,利用注意力机制对文本上下文依赖关系进行强化,得到文本表示包括:e=softmax(tanh(W1H))
T
o=eHW2
1×2k 2k×d
其中,e表示所有单词对文本的贡献程度,o为文本表示,W1∈R 、W2∈R 为可训练矩阵,d表示文档表示的维度。
6.根据权利要求1所述的一种基于长尾问题的多标签文本分类方法,其特征在于,头部标签分类器包括一层Sigmoid激活函数,文本表示输入头部标签分类器,将交叉熵损失函数作为头部标签分类器的损失函数,通过最小化损失函数求得头部标签的权重Whead,表示为:其中,为头部标签分类器预测得到的分类结果,o为文本表示,Whead表示头部分类器的权重,lhead表示头标签对应的标签数量,xi表示第i个文本,Dhead表示头部标签对应文本的集合,表示第i个文本对应第j个头部标签的预测概率,yij表示第i个文本对应第j个头部标签的实际概率,loss表示损失函数。
7.根据权利要求1所述的一种基于长尾问题的多标签文本分类方法,其特征在于,对头部标签文本表示和尾部标签文本表示分别进行采样,得到头部标签原型和尾部标签原型包括:在x个样本中,对于第i个头标签,文档表示为 那么第i个头标签原型为:在x个样本中,对于第j个尾标签,文档表示为 那么第j个尾标签原型为:其中, 表示第x个样本采样针对第i个头标签的向量表示; 表示第x个样本采样针对第j个尾标签的向量表示;avg{}表示对向量取均值。
8.根据权利要求1所述的一种基于长尾问题的多标签文本分类方法,其特征在于,权重转移模块将头部标签原型映射到头部标签权重上,并通过最小化迁移学习获取转移权重的过程包括:其中,τ表示迁移学习器函数,lhead表示头标签对应的标签数量, 表示第i个头标签原型,Wt表示转移权重矩阵, 表示第i个头标签的权重,Whead是左右徐头标签权重的集合;l head为头标签的数量。
9.根据权利要求1所述的一种基于长尾问题的多标签文本分类方法,其特征在于,尾部标签分类器的构建过程包括以下步骤:获取第i个头部标签对第j个尾部标签相关性的线性组合,表示为:利用注意力机制对第i个头部标签对第j个尾部标签相关性的线性组合进行处理,并对第i个头标签原型 进行加权,得到第j个尾部标签的新原型,表示为:aji=softmax(eji)
第j个尾部标签的新原型通过转移矩阵得到其对应的尾部标签分类器,表示为:其中, 表示头标签对尾标签的线性原型组合, 表示第i个头标签原型, 表示第j个尾标签原型;eji表示加性注意力机制处理后的头标签与尾标签相关性,W3表示注意力权重,aji表示注意力分数, 表示第j个头标签的注意力原型,avg表示求取向量的均值,jp表示第j个尾部标签的新原型;Wt表示转移权重矩阵, 表示第j个标签的尾部标签分类器权重。
10.根据权利要求1所述的一种基于长尾问题的多标签文本分类方法,其特征在于,将待分类数据的文本表示输入分类模块,得到分类结果包括:W=[Whead:Wtail]
其中, 表示分类结果,r表示待分类数据的文本表示;Whead表示头标签权重;Wtail表示尾标签权重。