1.一种改进聚类算法的大数据管理方法,其特征在于:包括如下步骤:S1、采集市场数据,将数据进行分类节点储存,并对采集的数据进行节点分类;
S2、基于S1节点储存的数据进行预处理,并将其进行格式转换;
S3、基于S2转换的数据进行评估,根据评估结果将数据重新分配,并监测节点的运行状态进行评估,根据评估结果对储存的数据进行调整;
S4、将S3的结果进行可视化显示,供用户进行评估;
所述S1对根据分类结果将数据进行分类节点储存的步骤如下:S1.1、采集用户上传的时长数据,并根据采集的数据大小建立多个运行节点;
S1.2、将采集的市场数据使用分布式数据库均匀储存在多个运行节点;
所述S2将其进行格式转换的步骤如下:
S2.1、对S1.2运行节点内的数据进行数据清洗和数据变换处理;
S2.2、基于S2.1处理完毕的数据进行特征提取,并将数据格式进行统一转换;
所述S3根据评估结果对储存的数据进行调整的步骤如下:S3.1、根据S2.2转换后的数据进行评估,根据评估结果将数据进行类别标签,并根据标签将数据重新分配至运行节点进行聚类分析;
S3.2、采集S3.1每个运行节点的负载数据并进行综合评估,根据评估结果对运行节点内的数据进行动态调整;
S3.3、采集用户后续上传的数据,并对运行节点的数据进行筛选,根据筛选结果采用增量更新方式进行聚类;
所述S3.1根据标签将数据重新分配至运行节点进行聚类分析的表达式如下:假设数据集中共有m条数据,每条数据有n个特征,可以表示为:对转换后的数据进行评估:采取轮廓系数评估指标,计算评估分数;
对评估结果进行分类:选择K‑Means聚类,对数据进行属性分类,根据轮廓系数和肘部法则得到最优K值,并使用该K值进行聚类分析,分配数据至运行节点进行聚类分析:采用MapReduce算法将数据分配至各个运行节点进行并行计算,提高聚类分析效率,伪代码如下:;
计算第i个数据点属于哪个类别; 表示循环从1到m,其中m表示数据集中的数据总数;
;
其中,K是聚类算法所得到的聚类个数,把第i个类别中的所有数据挑选出来,ci是一个符号,表示第i个数据点所属的类别,分配给对应的节点进行聚类计算 聚类计算结束后,通过汇总各个节点的计算结果,得到最终的聚类结果;
所述S3.2根据评估结果对运行节点内的数据进行动态调整的步骤如下:假设有n个运行节点,可以表示为:
采集各个节点的负载数据:通过监控系统,运行节点上的监控代理程序每隔一定时间采集节点的负载数据,CPU使用率、内存利用率、网络带宽数据,将其记录在监控日志中;
进行综合评估:对采集到的负载数据进行预处理和计算,得出该节点的负载状况评分,包括CPU使用率分数、内存使用率分数、网络带宽分数;通过综合考虑这些评分,得出该节点的综合负载评分,将所有节点的综合负载评分记录在一个负载表中以便后续的负载均衡调整;
动态调整各节点的负载:周期性地读取负载表中的运行节点负载评分,当运行节点的负载评分超过设定的阈值时,将该运行节点上的数据重新分配到空闲运行节点中,以实现负载均衡。
2.根据权利要求1所述的改进聚类算法的大数据管理方法,其特征在于:所述S2.2将数据格式进行统一转换的步骤如下:假设数据集中共有m条数据,每条数据有n个特征,该方法可以表示为:进行特征提取:从原始数据中提取出k个重要特征,转换为一个mtimesk的矩阵X;
进行数据标准化:将矩阵X按行进行数据标准化,得到标准化矩阵X';
将数据转换为适合聚类算法输入的形式:将标准化矩阵X'转换为m个n维向量的形式,表示为(x1,x2,...,xm),其中xi表示第i条数据的n个特征。
3.根据权利要求1所述的改进聚类算法的大数据管理方法,其特征在于:所述S3.3根据筛选结果采取增量更新方式进行聚类的表达式为:;
;
;
;
;
其中,D为数据集,C为聚类结果, 为新增的数据集,为相应的聚类结果, 表示聚类算法, 表示评估聚类结果的指标函数, 表示受影响的数据子集, 表示整个数据集中不属于 的子集。
4.用于实现改进聚类算法的大数据管理系统,包括权利要求1‑3中任意一项所述的改进聚类算法的大数据管理方法,其特征在于:包括采集储存单元(10)、数据处理单元(20)、分析分配单元(30)以及数据显示单元(40);
所述采集储存单元(10)用于对采集市场数据,将数据进行分类节点储存,并对采集的数据进行节点分类;
所述数据处理单元(20)用于将采集的数据进行预处理,并将其进行格式转换;
所述分析分配单元(30)用于对转换的数据进行评估,根据评估结果将数据重新分配,并监测节点的运行状态进行评估,根据评估结果对储存的数据进行调整;
所述数据显示单元(40)用于将结果进行可视化显示,供用户进行评估。