1.一种基于语义嵌入和混合神经网络的日志异常检测方法,其特征在于,包括:获取实时日志数据并利用固定解析树结构解析实时日志数据,提取获得日志事件模板;对日志事件模板进行序列化处理形成日志模板序列;
基于预训练的RoBERTa模型和平滑逆频率算法由日志模板序列提取日志事件模板的语义特征,包括:将日志事件模板中第i个单词 输入至预训练的RoBERTa模型获得词向量;
根据单词 在日志数据集中出现的次数获得逆文档频率,基于逆文档频率计算获得平滑逆频率权重;表达公式为:;
公式中, 为平滑逆频率权重, 表示为单词 在日志数据集中的出现的概率; 表示为调节的超参数; 表示为单词 的逆文档频率;K表示为平滑常数;
对平滑逆频率权重引入词性权重因子c获得单词 的权重 , 通过对权重和词向量进行加权求和生成日志事件模板的句向量,表达公式为:;
;
其中, 表示为词向量,X表示为句子中单词集合,n表示为句向量中词向量的数量,为去除最大主成分前的句向量, 表示为为所有 构成的矩阵通过奇异值分解的特征矩阵; 为 的转置; 为 的最大主成分向量; 表示为日志事件模板的句向量;
将生成的句向量映射到对应的日志模板序列中,得到日志模板序列的特征向量;对日志模板序列的特征向量进行白化处理后,组织成矩阵形式获得日志事件模板的语义特征;
混合神经网络模型的构建过程为:使用多尺度卷积神经网络、高效通道注意力机制和形变门控循环单元构建所述混合神经网络模型;获取日志数据集并利用日志数据集对所述混合神经网络模型进行训练,输出训练后的混合神经网络模型;
将日志事件模板的语义特征输入至训练后的混合神经网络模型获得日志检测结果,包括:将日志事件模板的语义特征输入至所述多尺度卷积神经网络,对语义特征进行多尺度特征提取获得关键语义向量,过程包括:所述多尺度卷积神经网络包括一维卷积层、批量归一化层、ELU激活函数和池化层;所述一维卷积层设置有多种尺度的卷积核;
通过多种尺度的卷积核由日志事件模板的语义特征中提取获得局部特征向量;将局部特征向量输入至所述批量归一化层获得关键拟合特征,表达公式为:;
公式中, 是缩放参数; 是偏移参数; 是局部特征向量 的均值; 是局部特征向量 的方差;表示为调节参数; 表示为关键拟合特征;
通过ELU激活函数将第一中间特征进行映射转换获得关键映射特征,表达公式为:;
公式中,表述为调节参数, 表示为关键映射特征;e为自然底数;
将关键映射特征输入至池化层获得关键语义向量;
将关键语义向量输入至所述高效通道注意力机制,由关键语义向量中捕获日志局部特征输出中间特征,过程包括:所述高效通道注意力机制包括全局平均池化层、自适应卷积层和sigmoid函数;
将所述关键语义向量输入至全局平均池化层获得全局关系特征;基于当前总通道数计算自适应卷积层中卷积核尺寸K值,表达公式为;
;
其中, 表示为选取最接近的奇数;c代表为当前总通道数; 和 表示为设定常数;
将全局关系特征输入至自适应卷积层获得特征权重 ,表达公式为;
;
其中, 代表与 相邻的k个通道的输出特征集合, 代表与 相邻的第k个通道的输出特征; 表示为全局关系特征; 代表所有通道共享的权重参数; 为sigmoid激活函数;
将特征权重 与关键语义向量相乘获得中间特征;
将中间特征输入至形变门控循环单元,由中间特征中捕获日志全局特征输出日志检测结果,过程包括:将中间特征与预设的隐藏状态进行多轮信息交互,当信息交互轮数为奇数时,基于隐藏状态对中间特征进行更新,表达公式为:;
公式中, 表示为第 轮信息交互后的中间特征; 表示为第 轮信息交互后的中间特征; 表示为第 轮信息交互后的隐藏状态; 表示为可学习的参数矩阵;
⊙是哈达玛积;
当信息交互轮数为偶数时,基于中间特征对隐藏状态进行更新,表达公式为:;
公式中, 表示为第 轮信息交互后的隐藏状态; 表示为第 轮信息交互后的隐藏状态; 表示为可学习的参数矩阵; 表示为第 轮信息交互后的中间特征; 为sigmoid激活函数;
将信息交互更新后中间特征和隐藏状态输入至形变门控循环单元的基本神经单元cell获得最终隐藏状态,计算公式为:;
;
;
;
公式中, 表示为时间步t下更新门的输出值; 表示为时间步t下重置门的输出值,表示为时间步t下输入基本神经单元cell的中间特征; 表示为时间步t下输入基本神经单元cell的隐藏状态; 表示为时间步t下候选隐藏层状态; 表示为时间步t下的最终隐藏状态; 、 和 表示为权重矩阵;
基于所有最终隐藏状态的出现概率与实时日志数据中下一条日志项进行对比输出日志检测结果。
2.根据权利要求1所述的日志异常检测方法,其特征在于,利用固定解析树结构解析实时日志数据,提取获得日志事件模板的过程包括:将实时日志数据中的特殊符号和变量特征替换为通配符后,将多个连续通配符号进行合并获得实时简化日志;
构建一个固定解析树结构,所述固定解析树结构的每个节点代表实时简化日志集合;
在固定解析树结构的第一层,根据实时简化日志中的常量标记长度进行初步搜索,对实时简化日志进行初级分组;
在固定解析树结构的第二层,根据实时简化日志的常量标记进行精确匹配,对实时简化日志进行二级分组;
在固定解析树结构的第三层,在二级分组的实时简化日志中选定日志初始模板;计算实时简化日志与日志初始模板之间的字面相似度;
若实时简化日志与日志初始模板相似度高于或等于设定相似度阈值 ,则将实时简化日志归类为日志初始模板的实例;基于实时简化日志对日志初始模板进行更新;
如果实时简化日志与日志初始模板相似度低于设定相似度阈值 ,则根据实时简化日志新建日志初始模板添加到固定解析树结构中;
对固定解析树结构中的各日志初始模板进行计算混合相似度, 如果两日志初始模板之间混合相似度高于或等于设定相似度阈值 ,将两日志初始模板进行合并生成新的日志初始模板;
重复迭代直至完成所有实时日志数据的解析,输出最终的日志初始模板作为日志事件模板。
3.根据权利要求2所述的日志异常检测方法,其特征在于,计算实时简化日志与日志初始模板之间的字面相似度,表达公式为:;
公式中, 为实时简化日志与日志初始模板之间的字面相似度,表示实时简化日志和日志初始模板之间最长公共子序列的长度;M表示为实时简化日志;T为日志初始模板,m和n分别表示实时简化日志和日志初始模板的长度,λ为控制日志长度差异惩罚程度的调整权重。
4.根据权利要求2所述的日志异常检测方法,其特征在于,对固定解析树结构中的各日志初始模板进行计算混合相似度,表达公式为:;
公式中, 为日志初始模板A和日志初始模板B的混合相似度;e为自然底数;为权重系数,A和 B为日志初始模板,a为日志初始模板A的长度;b为日志初始模板B的长度; 为相似度调整参数。
5.根据权利要求1所述的日志异常检测方法,其特征在于,对日志事件模板进行序列化处理形成日志模板序列,包括:将日志事件模板按照时间戳进行排序形成日志事件模板队列;
根据日志事件模板出现的次数设定窗口大小,表达公式为;
其中, 为在日志事件模板队列中最多的日志事件模板出现的次数, 为最少的日志事件模板出现的次数, 表述为窗口大小;
根据日志事件模板的频率和持续性设定步长;获取日志事件模板的节点ID,由步长、节点ID和窗口大小组成滑动窗口;利用滑动窗口对所述日志模板序列进行划分获得日志模板序列。