1.一种基于上下文的多重金融关系图欺诈节点检测方法,其特征在于,包括如下步骤:步骤S1:基于金融领域数据构建的图结构数据集预处理:在每个关系图内,将节点在此关系图下的邻居划分为5个集合,分别为:一阶已知标签的正类节点集,一阶已知标签的负类节点集,二阶已知标签的正类节点集,二阶已知标签的负类节点集,二阶未知标签的节点集;对每个邻域节点集合进行平均池化后,组合得到该节点的邻域池化特征矩阵;
步骤S2:为每个节点计算全局上下文特征:利用邻域池化特征矩阵和注意力机制为每个节点生成全局上下文特征;
步骤S3:在每个关系图内,利用全局上下文特征计算边的权重,过滤掉噪声边:利用连边两侧节点的原始特征与全局上下文特征,计算连边的权重;
步骤S4:在每个关系图内,在过滤噪声边之后,为每个节点计算该关系图下的语义特征;
步骤S5:将节点自身特征,节点的全局上下文特征,节点在任意关系图下的语义特征横向拼接,通过多层感知机MLP得到节点的最终特征表示;
步骤S6:将节点的最终特征表示经过多次乘以权重矩阵并加上偏置后,维度数量变为
2,用于预测节点是正类节点或负类节点的概率;结合概率与真实标签计算损失函数,损失函数是交叉熵损失函数;通过梯度反向传播更新参数训练模型;利用交叉熵损失反向传播,更新所有可训练参数来训练模型;
步骤S7:使用训练的模型检测欺诈节点;利用训练的模型为任意节点计算预测概率分布,对于这个2维的向量,默认当第1维对应的数字更大时,该节点被认为属于正常节点,当第2维对应的数值更大时,该节点被认为属于欺诈节点。
2.根据权利要求1所述的基于上下文的多重金融关系图欺诈节点检测方法,其特征在于,步骤S1中,数据集为图结构数据 其中 为节点集合, 为所有节点
的原始特征组成的矩阵,N表示节点数量,s表示原始特征的维度数量; 为边集,εr是在指定关系类型为r下的连边集合,R表示关系图的种类总数, 是所有节点的标签集合;用表示图中第i个节点, 为此节点的标签;对于节点vi,在关系r的图中邻居划分为:一阶已知标签的正类节点集 一阶已知标签的负类节点集 二阶已知标签的正类节点集 二阶已知标签的负类节点集 二阶未知标签的节点集对节点vi所有关系图下所有邻居节点集合内节点特征进行平均池化,组合后得到第i个节点vi的邻域池化特征矩阵
3.根据权利要求2所述的基于上下文的多重金融关系图欺诈节点检测方法,其特征在于,步骤S2中全局上下文特征通过以下方式计算:其中 表示第i个节点的全局上下文特征;atti,j表示第i个节点和第j个邻域之间的权重;exp(·)是应用到数值e上的指数函数; 表示由第i个节点的邻域池化特征矩阵,E表示标准正态分布权重矩阵,用于区分不同类型的邻域节点集合;与Si相加后得到表示邻域被区分后的第i个节点的邻域池化特征矩阵; 是经过E区分后,第i个节点在第j个邻域得到的邻域池化特征矩阵,由 中截取指定维度特征得到;xi是q k v q第i个节点的原始特征,W ,W ,W都是可训练权重矩阵,Qi是xi在W映射空间下的特征,Ki,j是k v在W映射空间下的特征,Vi,j是 在W映射空间下的特征。
4.根据权利要求3所述的基于上下文的多重金融关系图欺诈节点检测方法,其特征在于,步骤S3中连边的权重通过以下方式计算:w
其中W 是可训练权重矩阵,xi是第i个节点vi的原始特征, 是节点vi的全局上下文特征,xj是第j个节点vj的原始特征, 是节点vj的全局上下文特征;Concat(·)是拼接函数,表示将xi, xj, 这四个向量横向拼接;Sigmoid(·)是激活函数,计算公式为 wi,j是节点vi和节点vj之间的权重,取值范围在0到1之间。
5.根据权利要求4所述的基于上下文的多重金融关系图欺诈节点检测方法,其特征在于,步骤S4中语义特征通过以下方式计算:其中 是节点vi在关系为r的图上提取到的语义特征;Nr(vi)表示节点vi在关系为r的图上的邻居集合,Nr(vj)表示节点vj在关系为r的图上的邻居集合,wi,j是节点vi和节点vj之间的权重,wi,k表示节点vi和节点vk之间的权重,wj,k表示节点vj和节点vk之间的权重,xj表示第rj个节点的原始特征,W是可训练的权重矩阵;用于表示节点vi的重要性程度, 用于表示节点vj的重要性程度。
6.根据权利要求5所述的基于上下文的多重金融关系图欺诈节点检测方法,其特征在于,步骤S5中最终特征表示通过以下方式计算:c
其中W是权重矩阵,zi是第i个节点的最终特征表示。
7.根据权利要求6所述的基于上下文的多重金融关系图欺诈节点检测方法,其特征在于,步骤S6中,将节点的最终特征表示经过特征映射后预测节点是正类节点或负类节点的概率,通过以下方式计算:其中 是第i个节点的预测概率分布,W1,W2是权重矩阵,b1,b2是偏置,W1,W2,b1,b2都属于可训练参数;σ(·)是激活函数,选择ReLU激活函数;ReLU(x)=max(x,0);
结合概率与真实标签计算损失函数,通过梯度反向传播更新参数训练模型,分类任务的损失函数通过如下公式计算:Vtrain代表训练集中所有节点的集合,yi是第i个节点的真实标签, 是第i个节点的预测概率分布, 是模型中所有涉及的可训练参数的L2范数之和,用于约束模型防止过度训练导致过拟合;α是一个超参数,取值范围正数;
通过损失函数对模型中的可训练参数求导,经过多次梯度更新得到有效的模型。