1.一种基于联邦学习的多标签数据聚类分割方法,其特征在于,该方法包含如下步骤:
S1:中央服务器加载原始的多标签数据集,使用卷积神经网络提取图像特征,并与图像原始多标签信息拼接成特征向量;
S2:中央服务器对多标签数据集根据步骤S1拼接得到的特征向量进行聚类处理;
S3:中央服务器根据全局参数设置的分布类型及联邦客户端数量,将数据集基于聚类结果划分为遵循分布类型的数据并分配给各个联邦客户端;具体为:根据全局预设参数将聚类后的数据集根据五种不同的多标签分布方式进行分割为与参与客户端数量相同的子集,并逐一分配给各个参与客户端,五种多标签分布方式分别为:平衡且独立同分布、不平衡且独立同分布、病态分区、模拟现实情况分布和混合分布,所述混合分布由病态分区和模拟现实情况分布混合而成;
S4:对每个联邦客户端的数据进行图像预处理,分割为训练集和测试集,并保存配置信息以及训练集与测试集划分,完成多标签数据聚类分割。
2.根据权利要求1所述的基于联邦学习的多标签数据聚类分割方法,其特征在于,步骤S1中,中央服务器加载原始的多标签数据集,输入预训练的卷积神经网络ResNet中提取图像特征,并生成各个图像的特征向量。
3.根据权利要求2所述的基于联邦学习的多标签数据聚类分割方法,其特征在于,步骤S1中,将图片多标签数据用独热编码形式转换为多标签向量,并与图像的特征向量拼接,综合表示图像的视觉信息和语义信息。
4.根据权利要求1所述的基于联邦学习的多标签数据聚类分割方法,其特征在于,针对模拟现实情况分布,对多标签数据集基于聚类结果进行狄利克雷分割,以模拟现实情况下的数据分布。
5.根据权利要求1所述的基于联邦学习的多标签数据聚类分割方法,其特征在于,针对混合分布,对一定比例的数据采用模拟现实情况分布划分并分配给对应比例的客户端,并对剩余数据采用混合病态分区划分并分配给剩余客户端,该比例在全局参数中设置。
6.根据权利要求1所述的基于联邦学习的多标签数据聚类分割方法,其特征在于,步骤S3中,对每个客户端分配到的图像进行预处理,包括调整尺寸、随机裁剪、水平翻转和归一化操作。
7.一种基于联邦学习的多标签数据聚类分割系统,其特征在于,该系统包括特征提取模块、数据聚类模块、数据分割模块和配置存储模块;
所述特征提取模块用于中央服务器提取多标签数据集中的图像特征,与图像原始多标签信息拼接成特征向量;
所述数据聚类模块用于中央服务器对多标签数据集根据特征向量进行聚类处理;
所述数据分割模块用于中央服务器根据全局参数设置的分布类型及联邦客户端数量,将数据集基于聚类结果划分为遵循分布类型的数据并分配给各个联邦客户端;具体为:根据全局预设参数将聚类后的数据集根据五种不同的多标签分布方式进行分割为与参与客户端数量相同的子集,并逐一分配给各个参与客户端,五种多标签分布方式分别为:平衡且独立同分布、不平衡且独立同分布、病态分区、模拟现实情况分布和混合分布,所述混合分布由病态分区和模拟现实情况分布混合而成;
所述配置存储模块用于对每个客户端的数据进行图像预处理,分割为训练集和测试集,并保存配置信息以及训练集与测试集划分,完成多标签数据聚类分割。
8.一种基于联邦学习的多标签数据聚类分割装置,包括存储器和一个或多个处理器,所述存储器中存储有可执行代码,其特征在于,所述处理器执行所述可执行代码时,实现如权利要求1‑6中任一项所述的一种基于联邦学习的多标签数据聚类分割方法。
9.一种计算机可读存储介质,其上存储有程序,其特征在于,所述程序被处理器执行时,实现如权利要求1‑6中任一项所述的一种基于联邦学习的多标签数据聚类分割方法。