利索能及
我要发布
收藏
专利号: 2022105735013
申请人: 华南师范大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.文本分类模型的训练方法,其特征在于,包括如下步骤:

S1:获取文本分类模型,所述文本分类模型为改进的BERT预训练模型,且所述改进的BERT预训练模型的嵌入层、编码层和输出层均设置有Dropout层,且Dropout层的概率值小于1;

S2:获取文本训练数据;

S3:将Dropout层的概率值设置为0,得到第一预训练模型,并将文本训练数据输入所述第一预训练模型,得到第一概率分布;

S4:将Dropout层的概率值设置为p(0

S5:利用第一概率分布和第二概率分布计算所述文本分类模型的损失函数,并利用损失函数对所述文本分类模型的参数进行优化,得到训练完成的文本分类模型;

其中,利用第一概率分布和第二概率分布计算所述文本分类模型的损失函数包括如下步骤:S51:计算第一概率分布和第二概率分布的交叉熵损失函数,即:

其中,P1(yi|xi)为第i个训练数

据(xi,yi)对应的第一概率分布,P2(yi|xi)为第i个训练数据(xi,yi)对应的第二概率分布;n为训练数据的数量;

S52:计算第一概率分布和第二概率分布的KL散度,即:

S53:利用第一概率分布和第二概率分布的交叉熵损失函数和第一概率分布和第二概率分布的KL散度计算所述文本分类模型的损失函数,即L=Lce+αLkl,其中:α是缩放因子,且α的取值范围是(0,10];

其中,利用损失函数对所述文本分类模型的参数进行优化为利用损失函数的梯度对所述文本分类模型的权重进行优化,即: 其中:Wt+1为所述文本分类模型第(t+1)次迭代时的权重;Wt为所述文本分类模型第t次迭代时的权重;η为学习率,其取值‑5 ‑4范围是[e ,e ]; 为权重Wt对应的损失函数梯度;

其中,利用损失函数的梯度对所述文本分类模型的权重进行优化包括如下步骤:利用伯努利分布对第一概率分布对应的交叉熵损失函数梯度进行优化,得到改进的损失函数梯度,且 其中:g′为改进的损失函数梯度;Bernoulli(1‑p)为伯努利分布,且p为Dropout层的概率值;

利用改进的损失函数梯度对所述文本分类模型的权重进行优化,且

2.文本分类模型的训练装置,其特征在于,包括第一获取模块、第二获取模块、第三获取模块、第四获取模块和更新模块;所述第一获取模块用于获取文本分类模型,所述文本分类模型为BERT预训练模型,且所述BERT预训练模型的嵌入层、编码层和输出层均设置有Dropout层,且Dropout层的概率值小于1;所述第二获取模块用于获取文本训练数据;所述第三获取模块将Dropout层的概率值设置为0,得到第一预训练模型,并将文本训练数据输入所述第一预训练模型,得到第一概率分布;所述第四获取模块将Dropout层的概率值设置为p(0

所述更新模块包括第一计算单元、第二计算单元和更新单元,所述第一计算单元用于利用第一概率分布和第二概率分布计算所述文本分类模型的损失函数;所述第二计算单元计算权重对应于损失函数的梯度;所述更新单元利用权重对应于损失函数的梯度对所述文本分类模型的权重进行优化,得到训练完成的文本分类模型;

所述第一计算单元用于利用第一概率分布和第二概率分布计算所述文本分类模型的损失函数包括如下步骤:计算第一概率分布和第二概率分布的交叉熵损失函数,即:

其中,P1(yi|xi)为第i个训练数

据(xi,yi)对应的第一概率分布,P2(yi|xi)为第i个训练数据(xi,yi)对应的第二概率分布;n为训练数据的数量;

计算第一概率分布和第二概率分布的KL散度,即:

利用第一概率分布和第二概率分布的交叉熵损失函数和第一概率分布和第二概率分布的KL散度计算所述文本分类模型的损失函数,即L=Lce+αLkl,其中:α是缩放因子,且α的取值范围是(0,10];

其中,所述第二计算单元计算权重对应于损失函数的梯度为:利用伯努利分布对第一概率分布对应的交叉熵损失函数梯度进行优化,得到改进的损失函数梯度,且g′=其中:g′为改进的损失函数梯度;

Bernoulli(1‑p)为伯努利分布,且p为Dropout层的概率值;

3.文本分类模型的训练设备,其特征在于,包括存储器、处理器以及计算机程序,所述计算机程序存储在所述存储器中,并被配置为由所述处理器执行以实现如权利要求1所述的文本分类模型的训练方法。

4.计算机可读存储介质,其特征在于,其上存储有计算机程序,所述计算机程序被处理器执行以实现如权利要求1所述的文本分类模型的训练方法。