1.分布式系统故障判断与恢复方法,其特征在于:包括以下步骤,
S1、利用ApacheMesos作为资源管理器,构建虚拟资源池,并使用Mesos作为分布式操作系统的内核,处理资源分配及集中管理集群;
S2、在分布式操作系统中,依据Corosync,获取集群内若干组节点的相关状态数据信息,并构建节点数据集合,依据节点数据集合,并结合分布式一致性算法,判断出若干组故障节点,并做出相应标记;
S3、根据S2步骤中获取的若干组故障节点,检测分布式操作系统内相关资源运行数据信息及磁盘状态数据信息,以构建健康影响集合;
依据Corosync,实时传递集群信息与心跳信息,以获取集群内若干组节点的相关状态数据信息,并构建节点数据集合,其中,节点数据集合包括集群内节点数量Jdsz、各个节点发送心跳信号的时间戳及各个节点接收心跳信号的时间戳;
S4、通过将所述健康影响集合进行特征提取,以分别获取相应故障节点的磁盘使用率Csyz、CPU使用率Csz、坏块数量Hksz及I/O错误次数Cwp,通过利用深度学习技术,并结合训练后的健康预测模型,分析计算获取资源使用系数Zsxs及磁盘状态系数Czxs,并通过将所述资源使用系数Zsxs及所述磁盘状态系数Czxs相关联,拟合获取相应故障节点的健康指数Jkzs;
S5、预先设置预测阈值Q,并将所述预测阈值Q与相应故障节点的健康指数Jkzs进行对比分析,综合预测出当前故障节点恢复难易报表,并以可视化形式展现于计算平台;
设定固定的时间间隔TzTz,集群中每个发送节点以固定的时间间隔TzTz向接收节点发送心跳信号,以表明自己是活跃的,集群中接收节点接收到发送节点的心跳信号后,记录收到心跳的时间戳;
根据收到的心跳时间戳,接收节点初步判断发送节点是否存在故障风险,具体初步判断内容如下:
若第n次发送时间戳‑第n‑1次发送时间戳>固定的时间间隔TzTz时,接收节点将初步判断发送节点存在故障风险,并将发送节点标记为判断节点;
若第n次发送时间戳‑第n‑1次发送时间戳≤固定的时间间隔TzTz时,接收节点将初步判断发送节点未存在故障风险。
2.根据权利要求1所述的分布式系统故障判断与恢复方法,其特征在于:当接收节点将初步判断发送节点存在故障风险时,接收节点将向集群发出投票请求,进行综合判断,具体内容如下:接收到投票请求的节点将根据自身最近接收到该判断节点的心跳信号时间戳,来分析当前判断节点是否存在故障风险,当接收到投票的节点分析出判断节点存在故障风险时,返回指令,并向外发出肯定投票,当接收到投票的节点分析出判断节点未存在故障风险时,返回指令,并向外发出否定投票;
根据接收到投票请求的节点做出的肯定投票和否定投票情况,获取肯定投票数量Kts和否定投票数量Fts;
若所述肯定投票数量Kts>所述否定投票数量Fts时,此时将判断节点分析为故障节点,并做相应标记,以便做进一步分析;
若所述肯定投票数量Kts≤所述否定投票数量Fts时,此时将判断节点分析为非故障节点。
3.根据权利要求2所述的分布式系统故障判断与恢复方法,其特征在于:根据标记的故障节点获取故障节点数量Gj,并根据集群内节点数量Jdsz,计算获取故障占比Gjs,同时检测分布式操作系统内相关资源运行数据信息及磁盘状态数据信息,以构建健康影响集合,所述健康影响集合包括相关资源运行数据信息及磁盘状态数据信息;
其中,所述相关资源运行数据信息包括CPU使用率Csz、内存使用率Nsi、磁盘使用率Csyz及运行温度情况;
所述磁盘状态数据信息包括监测周期内各个监测时间点上的坏块数量Hksz、监测周期内各个监测时间点上的I/O错误次数Cwp,并利用统计学求均值算法,分别获取监测周期内坏块数量的均值Hkszavg和监测周期内I/O错误次数的均值Cwpavg;
同时,使用卷积神经网络构建初级模型,并以相关资源运行数据信息及磁盘状态数据信息对初级模型进行训练和测试,并将训练后的初步模型作为信息识别模型,分别获取其内的特征信息,并将获取的特征信息对信息识别模型进行训练和测试,结合获取的故障占比Gjs,将训练后的信息识别模型作为健康预测模型。
4.根据权利要求3所述的分布式系统故障判断与恢复方法,其特征在于:根据健康预测模型,并结合深度学习技术,分别计算获取资源使用系数Zsxs及磁盘状态系数Czxs,所述资源使用系数Zsxs及磁盘状态系数Czxs分别通过以下公式获取:式中,α及β为权重系数,Csz表示为CPU使用率,Csyz表示为磁盘使用率,Nsi表示为内存使用率,V表示为第一修正常数;
式中,n表示为监测时间点数,i=1、2、3、...、n,Hkszi表示为第i监测时间点内的坏块数量,Hkszavg表示为监测周期内坏块数量的均值,Cwpi表示为第i监测时间点内的I/O错误次数,Cwpavg表示为监测周期内I/O错误次数的均值。
5.根据权利要求4所述的分布式系统故障判断与恢复方法,其特征在于:通过将所述资源使用系数Zsxs及所述磁盘状态系数Czxs做线性归一化处理后,将对应的数据值映射至区间0,1内,拟合获取相应故障节点的健康指数Jkzs,相应故障节点的健康指数Jkzs通过以下公式获取:式中,Ccn表示为TCP重传率,Gjs表示为故障占比,其中,e表示为欧拉数,数值约为
2.71828。
6.根据权利要求1所述的分布式系统故障判断与恢复方法,其特征在于:将所述预测阈值Q与相应故障节点的健康指数Jkzs进行对比分析,综合预测出当前故障节点的恢复难易报表,具体内容如下:若相应故障节点的健康指数Jkzs≥所述预测阈值Q时,综合预测出当前故障节点的恢复能力处于异常状态,此时相应的故障节点从集群中隔离,并停止对该故障节点的任务分配和数据通信,同时向系统管理员发送预警指令;再利用分布式存储系统中的备援节点来恢复故障节点上的数据,将该故障节点上的任务和数据重新分配到备援节点上,此时备援节点将在5秒钟内接管该故障节点的职责,尝试进行自动化的故障修复操作,若自动化修复无效,等待系统管理员进行人工干预;
若相应故障节点的健康指数Jkzs<所述预测阈值Q时,综合预测出当前故障节点的恢复能力处于正常状态,此时尝试自动修复故障节点,自动修复手段包括重启节点、恢复配置及重新加载服务,并监测修复过程,在故障节点恢复后,使用分布式一致性协议进行数据同步和一致性验证,在故障节点恢复后,进行健康状态验证,确认节点已经恢复到正常状态并能够稳定运行,在该故障节点恢复正常后,将该故障节点重新加入集群,并重新分配任务和资源。
7.一种云操作系统,应用权利要求1~6任一项所述的分布式系统故障判断与恢复方法,特征在于:包括构建模块、第一监测模块、故障锁定模块、第二监测模块、健康评估模块及预测管理模块;
所述构建模块,利用ApacheMesos作为资源管理器,构建虚拟资源池,并使用Mesos作为分布式操作系统的内核,处理资源分配及集中管理集群;
所述第一监测模块,在分布式操作系统中,依据Corosync,获取集群内若干组节点的相关状态数据信息,并构建节点数据集合;
所述故障锁定模块,依据节点数据集合,并结合分布式一致性算法,判断出若干组故障节点,并做出相应标记;
所述第二监测模块,根据S2步骤中获取的若干组故障节点,检测分布式操作系统内相关资源运行数据信息及磁盘状态数据信息,以构建健康影响集合;
所述健康评估模块,通过将所述健康影响集合进行特征提取,以分别获取相应故障节点的磁盘使用率Csyz、CPU使用率Csz、坏块数量Hksz及I/O错误次数Cwp,通过利用深度学习技术,并结合训练后的健康预测模型,分析计算获取资源使用系数Zsxs及磁盘状态系数Czxs,并通过将所述资源使用系数Zsxs及所述磁盘状态系数Czxs相关联,拟合获取相应故障节点的健康指数Jkzs;
所述预测管理模块,预先设置预测阈值Q,并将所述预测阈值Q与相应故障节点的健康指数Jkzs进行对比分析,综合预测出当前故障节点恢复难易报表,并以可视化形式展现于计算平台。
8.一种计算平台,其特征在于:所述一种计算平台至少包括一个处理器、存储器和输入输出单元;
其中,所述存储器用于存储计算机程序,所述处理器用于调用所述存储器中存储的计算机程序来执行如权利要求1至6中任一项所述的分布式系统故障判断与恢复方法。