1.一种基于多源知识融合的APT攻击检测方法,其特征在于,所述基于多源知识融合的APT攻击检测方法,包括:收集良性日志数据,提取良性日志数据中的实体以及实体间的事件交互信息,利用良性嵌入模型对实体进行嵌入得到良性向量,并根据实体间的事件交互信息计算每个实体的总频率、总出度和总入度,将良性向量、总频率、总出度和总入度保存至良性行为知识库;所述良性嵌入模型为基于提取的实体的路径名以及实体间的事件交互信息,将路径名视为文本序列,将路径名中的各个部分视为单词,使用Word2vec模型对路径名中的各个部分进行嵌入实现;
收集网络威胁情报构建为多个攻击场景图,将每个攻击场景图中的最长路径作为句子,并利用威胁嵌入模型对句子进行嵌入得到威胁向量;其中使用Doc2vec模型对最长路径进行嵌入,并保存Doc2vec模型为威胁嵌入模型;
获取待检测日志数据并构建起源图;
使用良性嵌入模型对起源图中的节点进行嵌入得到待检测向量,计算待检测向量与良性行为知识库中的良性向量的相似度,取相似度低于阈值的节点作为可疑节点;
根据良性行为知识库中实体的总频率、总出度和总入度,计算每个可疑节点所在的每条路径的罕见得分,选择罕见得分最高的前 条路径作为候选路径, 为候选路径数量筛选阈值;
利用威胁嵌入模型对每个可疑节点的每条候选路径生成查询向量,取与查询向量的相似度最大的前 个威胁向量,将查询向量与威胁向量形成一个线索输入大语言模型,为威胁向量数量筛选阈值;
取被大语言模型判定为异常的可疑节点作为异常节点,并对所有异常节点进行聚合,得到多个异常集群,取平均罕见得分最高的异常集群重建攻击图;
其中,所述计算每个可疑节点所在的每条路径的罕见得分,包括:对于一个可疑节点,分别向前和向后搜索 跳邻居,得到一条或多条路径;
对于可疑节点 的每一条路径 , 表示路径中的第 个事件,计算其中每个事件 的频率得分,如下:
;
;
;
;
其中,每个事件 为三元组形式, , 表示事件 的源节点, 表示事件的目标节点, 表示事件 的事件类型, 表示事件 的频率得分, 表示事件的出度占比, 表示事件 的频率占比, 表示事件 的入度占比,表示从节点 到节点 的事件类型 的总频率, 表示从节点 到目标节点 的事件类型 的总频率, 表示从节点到所有目标节点的所有事件类型的总频率的总和, 表示节点 的总出度,表示节点 的总出度, 为起源图中的第 个节点, 表示节点 的总入度, 表示节点 的总入度;
其中, 、 和 根据起源图中事件交互信息计算得到,、 和 从良性行为知识库中获取,若获取失败,则直接赋值 , 为预设值;
;
式中, 为可疑节点 的每条路径 的罕见得分。
2.根据权利要求1所述的基于多源知识融合的APT攻击检测方法,其特征在于,所述根据实体间的事件交互信息计算每个实体的总频率、总出度和总入度,包括:;
;
;
式中, 表示源节点, 表示目标节点, 表示一类事件类型, 表示从源节点 到目标节点 的事件类型 的总频率, 表示 时刻从源节点到目标节点 的事件类型 的频率, 表示节点 的总出度,此时节点 作为源节点, 表示从节点 到目标节点 的事件类型 的总频率,表示从节点 到所有目标节点的所有事件类型的总频率的总和,表示节点 的总入度,此时节点 作为目标节点, 表示从源节点到节点 的事件类型 的总频率, 表示从所有源节点到节点 的所有事件类型的总频率的总和,表示所有事件类型中的任一事件类型。
3.根据权利要求1所述的基于多源知识融合的APT攻击检测方法,其特征在于,所述计算待检测向量与良性行为知识库中的良性向量的相似度,包括:;
式中, 表示待检测向量, 表示良性行为知识库中的良性向量, 表示待检测向量和良性向量的点积, 表示向量的模, 表示待检测向量 与良性向量 的相似度。
4.根据权利要求1所述的基于多源知识融合的APT攻击检测方法,其特征在于,所述对所有异常节点进行聚合,得到多个异常集群,包括:取异常节点的候选路径形成罕见事件列表;
将罕见事件列表与由敏感文件组成的关键词列表有交集的异常节点划分至同一个异常集群,其他节点作为待筛选节点;
针对待筛选节点,如果一个节点出现在另外一个节点的罕见事件列表中,则将两个节点划分为同一个异常集群。
5.根据权利要求1所述的基于多源知识融合的APT攻击检测方法,其特征在于,所述异常集群的平均罕见得分计算如下:取异常集群中异常节点对应的候选路径的罕见得分进行累加,并在累加后除以异常集群中异常节点的数量,得到异常集群的平均罕见得分。
6.一种基于多源知识融合的APT攻击检测系统,包括处理器以及存储有若干计算机指令的存储器,其特征在于,所述计算机指令被处理器执行时实现权利要求1至权利要求5中任意一项所述基于多源知识融合的APT攻击检测方法的步骤。