利索能及
我要发布
收藏
专利号: 2022117141035
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于半监督学习的标签抗噪文本分类方法,其特征在于,包括以下步骤:S1:预训练:将文本分类任务本身的训练数据当作无标签数据进行预训练并预测出每个样本在每个类别上的概率 所述训练样本,即文本分类任务中每一条需要分类的文本样本;

S2:噪声数据划分:将步骤S1预测得到的概率 和原带噪标签作为置信学习的输入,通过置信学习方法划分出噪声数据U和干净数据C;所述原带噪标签为原训练样本已经人为标记的标签;

S3:数据增强:将步骤S2得到的噪声数据U进行多种数据增强处理,得到扩充后的文本;

S4:集成学习:将步骤S3得到扩充后的文本,分别进行多种模型预测,预测出每个样本属于每个类别的概率;

S5:噪声样本重新标记:使用混合匹配方法,计算步骤S4得到的概率均值,并猜测其伪标签,即对每一条样本赋予一个新的预测标签,使用锐化方法进行熵最小化处理;

S6:重新训练并得到最终模型:使用混合方法将S5中重新标记的噪声数据U和干净数据C进行混合,构建新的训练样本和标签并进行模型重新训练,当损失函数最小时训练结束,得到最终的文本分类模型;所述混合方法是以线性插值的方式来构建新的训练样本和标签,对于样本(x1,y1)和样本(x2,y2),通过以下方式获得混合后的样本(x′,y′):

1 α‑1 α‑1

B(α,α)=∫0x (1‑x) dx

λ~Beta(α,α)

λ′=max(λ,1‑λ)

x′=λ′x1+(1‑λ′)x2

y′=λ′y1+(1‑λ′)y2

其中B(α,α)表示贝塔分布;λ′表示超参数;x′表示线性插值处理后的样本;α是超参数,λ是随机变量且服从Beta分布;

对于含有干净标签的数据C=((ci,pi);i∈(1,…,N))和重新预测标签的噪声数据将其串联(Concat)起来并洗牌(Shuffle)形成MixUp所需要的数据源W:

对于第i个样例,计算MixUp(Ci,Wi)加入到集合C′中,计算 加入到集合U′中,使得C转变为C′,转变为U′。

2.根据权利要求1所述的一种基于半监督学习的标签抗噪文本分类方法,其特征在于,所述步骤S1中,预训练使用任务自适应预训练方法TAPT;

(1)利用BERT作为预训练模型;

(2)所述任务自适应预训练方法TAPT即将该任务本身训练数据当作无标签数据进行第二阶段的预训练,得到任务自适应的预训练语言模型。

3.根据权利要求1所述的一种基于半监督学习的标签抗噪文本分类方法,其特征在于,所述步骤S2中,使用置信学习方法的计数和过滤两个步骤进行划分,所述置信学习不需要任何超参数,只需要两个输入,即预测概率 和带噪标签 主要使用以下步骤实现:(1)计数Count:估计噪声标签和真实标签的联合分布;计算公式如下*

其中,X表示样本;y为真实标签的估计值;置信度阈值tj表示每个人工标注类别j下的平均概率,计数矩阵 即人工标记为i但实际为j标签的样本个数,筛选出人工标记为i的样本集合,计算样本集合中实际标签为j的样本个数,即判断的样本个数;

(2)过滤Clean:找出并过滤掉错误样本,在得到计数矩阵后,选取进入非对角单元的样本作为含有噪声标签的样本,即

4.根据权利要求1所述的一种基于半监督学习的标签抗噪文本分类方法,其特征在于,所述步骤S3中,使用三种数据增强方法对噪声样本进行数据增强;所述三种数据增强方法分别为使用回译法、条件双向变换器编码器(方法和使用随机失活方法。

5.根据权利要求1所述的基于半监督学习的标签抗噪文本分类方法,其特征在于,所述步骤S4中,集成了三种预训练模型进行概率预测;所述三种预训练模型分别为:双向变换器编码器预训练模型BERT、大规模双向变换器编码器预训练模型RoBERT和语言理解的广义自回归预训练模型XLNet。

6.根据权利要求1所述的基于半监督学习的标签抗噪文本分类方法,其特征在于,所述步骤S5中,使用混合匹配方法并结合步骤S4的集成学习方法对噪声样本进行了重新标记,主要存在以下步骤:(1)标签猜测:对于单个没有标注的样例,计算经过数据增强和集成学习模型预测后的概率均值,猜测其“伪”标签,这个得到的标签会加入到无监督损失项 中,其数学表达式为:其中,K表示数据增强方法个数;M表示预测模型个数;pmodel表示模型预测为y的概率;y表示模型预测的标签结果; 表示第k个数据增强方法第b个未标记样本;

(2)锐化Sharpen:根据标签置信度wi,将噪声标签 与模型预测出的标签 进行线性组合,得到新的噪声标签 是对M个模型的平均预测,使用锐化的方法进行熵最小化处理:其中 是对M个模型的平均预测,T是温度参数,可以调节分类熵,调节T趋向0,则趋向于独热分布,即one‑hot分布,即对某一类别输出概率为1,其他所有类别输出概率为0,此时分类熵最低,L是分类的类别。

7.根据权利要求1所述的一种基于半监督学习的标签抗噪文本分类方法,其特征在于,在U′上使用L2损失,而在C′上使用交叉熵损失,二者的数学表达式如下:其中|C′|等于批大小batchsize,|U′|等于k倍的批大小batchsize,L是分类类别个数;

则得到最终的损失函数为:

L=Lc+λULU

其中,λU是无监督损失权重。