1.一种基于Transformer的云数据中心环境下任务故障预测方法,其特征在于该方法包括以下步骤:S1.将云数据中心环境下任务故障预测建模为一个基于时间序列的二分类问题:收集过去一定时间内的任务资源使用情况信息并形成时间序列,基于该时间序列预测任务是否会发生故障;
由一个或多个任务构成作业,每个所述任务都伴随着一组资源需求,对于作业层面的故障预测,只有该作业里所有任务都被预测为没有发生故障时,该作业才会被预测为没有故障;
S2.确定与任务故障相关的特征,包括资源使用情况、任务调度优先级、任务重新提交次数和调度延迟;
S3.结合一维卷积神经网络和Transformer模型对输入的时间序列进行特征提取,并根据提取的特征进行分类以预测云数据中心的任务以及作业是否会发生故障,其具体流程如下:S31.输入层:
在每个时间点,观察任务的CPU使用情况、内存使用情况、缓存使用情况、磁盘I/O时间、平均磁盘使用率、任务调度优先级、任务重新提交次数以及调度延迟;将这些特征设置为一个向量,作为每个时间点对任务的观测结果;这些向量将组成一个时间序列,作为预测模型的输入;
S32.一维卷积操作层:
在得到任务的输入时间序列后,将其经过一维卷积操作层以提取时序的局部特征;
S33.Transformer层:
在得到一维卷积操作层的结果后,通过Transformer层提取时序的全局特征;
S34.均值池化和全连接层:
在得到Transformer层的输出后,经过一层均值池化和全连接层学习不同特征之间的交互关系,再经过激活函数以输出分类概率;
将输出与阈值比较,以预测对应任务是否会为发生故障,而作业由一个或多个任务组成,其是否发生故障由该作业内所有任务的故障预测情况决定。
2.根据权利要求1所述的云数据中心环境下任务故障预测方法,其特征在于:S31中所述的时间序列所对应的时间窗口大小为w;对于任务运行不足w个时间点的部分,将不足的部分全部补零;通过补齐操作,使时间序列的长度维持在一个固定的大小。
3.根据权利要求1所述的云数据中心环境下任务故障预测方法,其特征在于:S32中所述的一维卷积操作层中一维卷积的计算如下:其中f1,i,k,m表示对于任务Xi来说,其输入数据在经过第k个卷积核操作后第m个位置的输出,A表示输入通道数,即输入数据的维度,bk,a表示第k个卷积核的通道a的偏置值,S表示一维卷积的卷积核尺寸,ωk,a,s表示第k个卷积核的通道a上,位置为s的数据;
将每个输出位置都通过上述计算即可得到一维卷积层的输出;
经过一维卷积层后再经过激活函数层,通过引入非线性变换,以让神经网络学到更加复杂的表示;
通过最大池化层对特征图进行压缩。
4.根据权利要求3所述的云数据中心环境下任务故障预测方法,其特征在于:每个通道的卷积核大小为3,卷积核数量为16,步长为1。
5.根据权利要求1所述的云数据中心环境下任务故障预测方法,其特征在于:S33所述的Transformer层:首先,对位置编码:
t
其中 表示任务Xi经过一维卷积操作层的第t个输出,e表示第t个时刻的位置嵌入信息, 表示输入编码器的第t个向量;
其次,利用Transformer中的多头自注意力机制,从不同子空间挖掘时序中不同时间点的权重,以更准确预测任务是否会发生故障;利用残差连接缓解梯度消失或爆炸,帮助神经网络学习到更好的特征表示;将残差连接所得到的结果经过层归一化;
然后,通过前馈神经网络层进一步提取每个时间点自身的特征;
最后,在经过前馈神经网络层之后再次经过残差连接和层归一化,得到Transformer编码器层的输出。