利索能及
我要发布
收藏
专利号: 202410722564X
申请人: 广东琴智科技研究院有限公司
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-18
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.集群容错能力判断方法,其特征在于:包括以下步骤:

S1、首先按照OpenStack的官方文档或指南,搭建OpenStack集群,在集群中安装并配置CNQual自动化测试工具,在与OpenStack集群进行交互,配置Prometheus和Grafana,收集OpenStack集群的各项性能指标,并通过Grafana实时展示和分析;

S2、使用ApacheJMeter编写详细的压力测试计划,按照预先定义的测试计划,启动JMeter进行压力测试,定期收集和保存压力测试期间的性能数据;

S3、通过在OpenStack集群中配置ChaosMonkey规则,选择故障类型和触发条件,再启动ChaosMonkey,注入故障,并观察OpenStack集群表现,记录故障发生时的性能指标和行为,随后观察系统的恢复过程;

S31、在OpenStack集群中安装和配置ChaosMonkey,定义故障类型,所述故障类型包括CPU异常负载、内存使用率异常、网络延迟、响应时间异常、吞吐量异常和错误率异常的云操作系统集群存在的性能瓶颈,再进行定义触发条件规则,随机选择时间在特定的负载条件下触发;

S32、启动ChaosMonkey并注入故障,在故障注入期间,使用Prometheus和Grafana实时监控OpenStack集群的性能指标,并将标记为故障性能指标集,所述故障性能指标集包括CPU利用率CPUafter、内存使用率MEMafter、网络流量NETafter、响应时间RTafter、吞吐量THRafter和错误率ERafter;

S33、在故障注入后,观察云操作系统集群的自动恢复能力,包括实例的重启、负载的重新分配,记录恢复过程中的性能变化,并分析收集到的故障性能指标集根据配置保存到数据库中;

S4、使用Grafana实时监控OpenStack集群的各项性能指标,持续收集压力测试和故障模拟期间的性能数据,并将其保存到数据库中,计算各个性能指标的变化率,再将变化率代入容错能力评分算法模型,获取系统的容错能力得分FTS;

S42、构建容错能力评分模型,将变化率代入容错能力评分模型,通过容错能力评分模型,量化评估云操作系统集群的容错能力,计算获取容错能力得分FTS;所述容错能力得分FTS通过容错能力评分模型输出获取,具体容错能力评分模型如下;

式中,a1、a2、a3、a4、a5和a6分别表示ΔCPU、ΔMEM、ΔNET、ΔRT、ΔTHR和ΔER的权重值,具体数值为管理员在系统配置文件中设置的权重值,介于0.0和1.0之间,且a1+a2+a3+a4+a5+a6=1.0,n表示计算终止位,i表示计算起始位,A表示修正系数,ΔCPU、ΔMEM、ΔNET、ΔRT、ΔTHR和ΔER分别表示CPU利用率变化量、内存使用率变化量、网络流量变化量、响应时间变化量、吞吐量变化量和错误率变化量;

S5、最后,将容错能力得分FTS的输出结果设置容错能力得分区间[0,1],并将容错能力得FTS的输出结果带入至得分区间[0,1]进行集群容错能力判断。

2.根据权利要求1所述的集群容错能力判断方法,其特征在于:

S11、选择云服务器来支持OpenStack的部署和运行,并安装配置Mesos作为操作系统的内核,按照OpenStack官方文档指南的说明,逐步安装OpenStack各个组件,包括控制节点、计算节点和存储节点,同时使用工具DevStack来简化安装过程,再配置OpenStack的网络,包括管理网络、外部网络和实例网络,使控制节点、计算节点和存储节点正常通信;

S12、通过包管理工具pip来安装CNQual,将CNQual能够与OpenStack集群进行交互,执行测试任务,并配置CNQual工具,包括指定OpenStack集群的地址和认证信息;

S13、再通过apt来安装配置Prometheus和Grafana,在Prometheus中配置采集器,定义需要收集的性能指标,所述性能指标包括CPU利用率、内存使用率、网络流量、响应时间、吞吐量和错误率,同时在Grafana中配置Prometheus作为数据源,确保Grafana能够从Prometheus获取数据,使用Grafana创建仪表盘,添加图表并配置展示性能指标。

3.根据权利要求2所述的集群容错能力判断方法,其特征在于:

S21、在云操作系统集群中安装ApacheJMete,启动ApacheJMete,并进行配置ApacheJMete的参数,包括线程数和时间,在ApacheJMete中创建一个新的测试计划,在测试计划中添加线程组,用于模拟并发用户设置线程组的属性,包括线程数、时间和循环次数;

S22、在线程组下添加Samplers,用于发送不同类型的请求,包括HTTP请求和数据库请求,并配置请求的目标URL、方法和参数对每个Sampler进行适当的配置,包括添加请求参数、HTTP请求头和认证信息;

S23、在测试计划中添加Listener,对Listener进行配置,包括设置保存文件路径、报告输出格式和图表类型,用于收集和展示压力测试期间的性能数据。

4.根据权利要求3所述的集群容错能力判断方法,其特征在于:

S211、在ApacheJMete中保存压力测试计划,点击ApacheJMete工具栏中的“启动”按钮,开始执行压力测试,通过ApacheJMete将模拟指定数量的用户并发送请求到目标系统,S212、在测试执行过程中,使用Prometheus和Grafana实时监控OpenStack集群的性能指标,并标记为压力性能指标集,所述压力性能指标集包括CPU利用率CPUbefore、内存使用率MEMbefore、网络流量NETbefore、响应时间RTbefore、吞吐量THRbefore和错误率ERbefore;

S213、再将在压力测试执行期间收集压力性能指标集,并根据配置保存到数据库中。

5.根据权利要求4所述的集群容错能力判断方法,其特征在于:

S41、再从云操作系统集群的数据库中,将在压力测试和故障模拟期间的性能数据进行持续收集到的压力性能指标集和故障性能指标集进行数据提取,进行分析OpenStack集群的性能指标在压力测试中和注入故障后各项性能指标进行数据处理,分析各项性能指标的变化率,具体数据处理方式如下;

式中,Δ表示变化量。

6.根据权利要求1所述的集群容错能力判断方法,其特征在于:

S51、构建容错能力得分区间[0,1],并将容错能力得分FTS输出的结果带入容错能力得分区间[0,1],对集群系统进行容错评估;具体的评估方案如下;

当容错能力得分FTS≥1时,表示云操作系统集群在故障模拟条件下各项性能指标性能卓越,此时则判断为“一级容错集群”;

当0<容错能力得分FTS<1时,表示云操作系统集群在故障模拟条件下各项性能指标一般,此时则判断为“二级容错集群”;

当容错能力得分FTS≤0时,表示云操作系统集群在故障模拟条件下各项性能指标低下,此时则判断为“三级容错集群”;

其中,“一级容错集群”>“二级容错集群”>“三级容错集群”的容错能力。

7.集群容错能力判断云操作系统集群,包括上述权利要求1~6任一项所述的集群容错能力判断方法,其特征在于:包括环境部署模块、压力测试模块、故障模拟模块、容错能力量化模块和容错能力判断模块;

所述环境部署模块用于搭建OpenStack集群,在集群中安装并配置CNQual自动化测试工具,配置Prometheus和Grafana以收集并展示OpenStack集群的性能指标,通过Grafana进行实时展示和分析;

所述压力测试模块用于使用ApacheJMeter编写详细的压力测试计划,对构建的

OpenStack集群进行压力测试,并实时收集压力性能指标集;

所述故障模拟模块用于在OpenStack集群中配置ChaosMonkey规则,进行故障模拟,并实时收集故障性能指标集;

所述容错能力量化模块用于将所获取的压力性能指标集和故障性能指标集,进行相关联计算云操作系统集群各项性能指标的变化率,再依据变化率进行构建容错能力评分算法模型,进行量化云操作系统集群的容错能力;

所述容错能力判断模块用于构建容错能力得分区间[0,1],并将容错能力得分FTS输出的结果带入容错能力得分区间[0,1],对云操作系统集群进行容错能力判断。

8.集群容错能力判断计算平台,其特征在于,所述集群容错能力判断计算平台包括:至少一个处理器、存储器和输入输出单元;

其中,所述存储器用于存储计算机程序,所述处理器用于调用所述存储器中存储的计算机程序来执行如权利要求1至6中任一项所述的集群容错能力判断方法。