1.一种应用于图结构数据聚类的局部信息保留深度对比聚类方法,其特征在于,包括依次连接的基于重构方式训练的可学习数据增强模块、图对比聚类模块、高置信度的采样模块;
所述基于重构方式训练的可学习数据增强模块使用神经网络根据不同的数据集动态地生成两个视图,它们之间共享充足的互信息用于下游的聚类任务;
所述图对比聚类模块负责将经过数据增强的样本输入模型的两个分支进行特征提取,拉近正样本特征的距离,拉远负样本的特征的距离,之后进行聚类;
所述高置信度的采样模块负责筛选出部分置信度较高而且具备了充足结构信息的正负样本,来提升图对比聚类模块提取有辨别性特征的能力,从而得到一个图聚类结果;
所述的基于重构方式训练的可学习数据增强模块包括两个非共享参数的图自编码器(100),以及一个边采样模块(200),其中,将图结构数据集(000)分别输入第一图卷积层(110)和第二图卷积层(111)进行特征提取,得到第一嵌入特征(120)和第二嵌入特征(121),之后将第一嵌入特征(120)和第二嵌入特征(121)输入第一解码器层(130)和第二解码器层(131)得到初步的数据增强视图;随后将两个视图输入边采样模块(200)得到第一数据增强视图(210)和第二数据增强视图(211);同时将第一嵌入特征(120)和第二嵌入特征(121)输入特征融合模块得到第一融合特征(140),第一融合特征(140)被输入第三解码器层(150)得到重构的图结构数据;
所述图对比聚类模块包括图滤波模块(300)和图对比模块(400);将第一数据增强视图(210)和第二数据增强视图(211)通过图滤波模块(300)进行特征聚合得到滤波后的第一特征矩阵(310)和滤波后的第二特征矩阵(311),之后通过图对比模块(400)的第一双层DNN层(410)和第二双层DNN层(411)进行特征提取,得到第一嵌入矩阵(420)和第二嵌入矩阵(421);
所述高置信度的采样模块(500)包括可信赖样本筛选和拓扑筛选两个部分;将图对比模块的第一嵌入矩阵(420)和第二嵌入矩阵(421)进行特征融合得到第二融合特征(430),并将第二融合特征(430)通过标准K‑means算法得到伪标签;之后根据伪标签对应样本与K‑means算法簇心的欧式距离来决定伪标签的可信程度,选取出同簇且可信程度大于阈值的作为正负样本,并使用邻接矩阵中目标节点的一阶邻域进一步的筛选得到目标正负样本;
第一图卷积层(110)和第二图卷积层(111)均采用了双层的GCNs,每一层使用ReLU作为激活函数,第一解码器层(130),第二解码器层(131),第三解码器层(150)均通过对嵌入矩阵内积得到重构的图结构数据,第一融合特征(140)采用两个嵌入矩阵取均值的方式;
边采样模块的边由原先邻接矩阵中的边和内积相似度最大的前K条边构成,其中K的取值在1到5之间,通过第一解码器层(130)和第二解码器层(131)得到的视图根据内积相似度的大小进行伯努利采样得到第一数据增强视图(210)和第二数据增强视图(211)。