1.一种基于生成式对抗网络的多任务分类消歧方法,其特征在于,包括以下步骤:(1)获取文本数据,编码每条文本数据获得文本向量,标记文本向量中的歧视特征,并给出每条文本数据的信用标签和收入标签,以构建样本集;
(2)基于生成式对抗网络构建训练系统,包括用于根据样本数据预测信用水平的第一分类器,用于根据样本数据预测收入水平的第二分类器,用于根据信用标签、收入标签、信用水平预测结果、收入水平预测结果生成编码向量的生成器;
(3)构建训练系统的损失函数,根据信用水平的预测结果和信用标签的交叉熵和生成器输出的编码向量与标记的歧视特征的交叉熵构建第一分类器的第一损失函数,根据收入水平的预测结果和收入标签的交叉熵和生成器输出的编码向量与标记的歧视特征的交叉熵构建第二分类器的第二损失函数,根据生成器的输入向量和输出编码向量的交叉熵构建生成器的第三损失函数;
(4)利用第一损失函数、第二损失函数、第三损失函数对训练系统进行训练,训练结束时,第一分类器及确定的参数组成信用预测模型,第二分类器及确定的参数组成收入预测模型;
(5)应用时,将文本数据编码成文本向量后,输入至信用预测模型和收入预测模型中,经计算获得信用预测结果和收入预测结果。
2.如权利要求1所述的基于生成式对抗网络的多任务分类消歧方法,其特征在于,采用onehot编码方式对每条文本数据进行编码,并将编码结果统一到固定长度,获得文本向量。
3.如权利要求1所述的基于生成式对抗网络的多任务分类消歧方法,其特征在于,生成器的输入向量的构建方式为:首先,利用sigmoid激活函数分别对第一分类器输出的信用水平预测结果和第二分类器输出的收入水平预测结果激活:s1=sigmoid(2*p1)
s2=sigmoid(2*p2)
其中,sigmoid()为sigmoid激活函数,p1、p2分别为信用水平预测结果和收入水平预测结果,s1、s2分别为p1、p2的sigmoid激活值;
然后,将sigmoid激活值s1、s2与信用标签t1、收入标签t2拼接成输入向量h1:h1=[(s1,s1*t1,s1*(1.0-t1)),(s2,s2*t2,s2*(1.0–t2))]。
4.如权利要求1所述的基于生成式对抗网络的多任务分类消歧方法,其特征在于,第一损失函数loss_d1为:第二损失函数loss_d2为:
第三损失函数loss_d3为:
loss_d3=-[yi*lnpi+(1-yi)ln(1-pi)]
其中, 为第i条文本数据的文本向量 经过第一分类器输出获得信用水平预测结果,Y1i为第i条文本数据对应的信用标签, 为文本向量 对应的生成器的输出,即将 对应的 Y2i以及Y1i拼接后输入至生成器得到的编码向量,gi为第i条文本数据的文本向量 中的歧视特征, 为第i条文本数据的文本向量 经过第二分类器输出获得收入水平预测结果,Y2i为第i条文本数据对应的收入标签,L(·)为交叉熵函数,Lc(·)为交叉熵函数,λ为权重参数,取值范围为0~1,l3为交叉熵函数计算得到的交叉熵损失,yi为第i条文本数据的真实标签,pi为生成器输出的第i条文本数据对应的输出向量。
5.如权利要求1所述的基于生成式对抗网络的多任务分类消歧方法,其特征在于,所述第一分类器、第二分类器均为两层线性回归神经网络和sigmoid激活层。
6.如权利要求1所述的基于生成式对抗网络的多任务分类消歧方法,其特征在于,所述生成器为两层线性回归神经网络和sigmoid激活层。
7.如权利要求1所述的基于生成式对抗网络的多任务分类消歧方法,其特征在于,对训练系统进行训练时,优化器采用adam,学习率采用指数衰减法,的dropout为0.8。
8.一种基于生成式对抗网络的多任务分类消歧装置,包括计算机存储器、计算机处理器以及存储在所述计算机存储器中并可在所述计算机处理器上执行的计算机程序,其特征在于,所述计算机存储器中采用权利要求1~7任一项所述的基于生成式对抗网络的多任务分类消歧方法构建的信用预测模型和收入预测模型;
所述计算机处理器执行所述计算机程序时实现以下步骤:
将文本数据编码成文本向量后,输入至信用预测模型和收入预测模型中,经计算获得信用预测结果和收入预测结果。