1.一种基于掩码自编码器的日志数据压缩和解压缩方法,其特征在于,所述基于掩码自编码器的日志数据压缩和解压缩方法,包括:实时采集日志数据,根据日志数据构建原始起源图,将原始起源图以固定的时间窗口划分成固定大小的子图,根据子图构建邻接矩阵、节点特征矩阵和行为权重矩阵;
构建掩码自编码器模型,对节点特征矩阵进行掩码处理,将邻接矩阵、行为权重矩阵和经过掩码处理的节点特征矩阵送入掩码自编码器模型的编码器,掩码自编码器模型的解码器接收编码器输出的表征向量,得到重构起源图;
重复将原始起源图重构为重构起源图,通过比较重构起源图与原始起源图计算重构误差,迭代更新掩码自编码器模型的训练参数,当重构误差达到预设值时完成掩码自编码器模型的训练;
将待压缩的日志数据的邻接矩阵、节点特征矩阵和行为权重矩阵输入训练好的掩码自编码器模型的编码器中,输出表征向量,即压缩后的日志数据;
将压缩后的日志数据输入训练好的掩码自编码器模型的解码器,得到重构起源图,将重构起源图以向量形式存储,完成日志数据的解压缩。
2.根据权利要求1所述的基于掩码自编码器的日志数据压缩和解压缩方法,其特征在于,所述根据子图构建邻接矩阵、节点特征矩阵和行为权重矩阵,包括:创建一个大小为N×N的零矩阵,其中N为子图中的节点数,如果子图中的节点i指向节点j存在有向边,则零矩阵的第i行第j列的元素为1,否则为0,遍历子图中的每一条有向边得到邻接矩阵;
根据预设的子图中每个节点的节点属性,为子图中的所有节点生成特征向量,创建一个大小为N×F×D的特征矩阵,其中N为子图中的节点数,F为节点属性的数量,D为所有特征向量中最高的维度,将每个节点对应的特征向量按照节点顺序填充到特征矩阵中,对维度小于D的特征向量的尾部作0填充,得到节点特征矩阵;
创建一个大小为N×N的零矩阵,其中N为子图中的节点数,遍历子图中的每一条有向边,根据有向边所代表的操作关系重要程度读取对应的权重值,如果子图中的节点i指向节点j存在有向边,则将对应的权重值填充到零矩阵的第i行第j列,得到行为权重矩阵。
3.根据权利要求2所述的基于掩码自编码器的日志数据压缩和解压缩方法,其特征在于,所述根据预设的子图中每个节点的节点属性,为子图中的所有节点生成特征向量,包括:读取子图中每个节点的节点属性,对表示类型的节点属性使用one‑hot编码生成类型特征向量,对文本类的节点属性使用经过预训练的BERT生成文本特征向量。
4.根据权利要求1所述的基于掩码自编码器的日志数据压缩和解压缩方法,其特征在于,所述掩码自编码器模型包括编码器和解码器,所述编码器采用图注意力网络,所述解码器采用Transformer网络。
5.根据权利要求1所述的基于掩码自编码器的日志数据压缩和解压缩方法,其特征在于,所述对节点特征矩阵进行掩码处理,包括:在子图中随机选择部分节点,在节点特征矩阵中将所述部分节点对应的特征向量以掩码标记MASK替代。