1.一种自然语言威胁情报抽取分析系统,其特征在于,包括:数据收集模块,采用数据采集技术,获取网络安全数据;
数据预处理模块,对网络安全数据进行预处理;
威胁识别模块,对经过预处理的网络安全数据进行初步威胁识别,利用轻量级NLP模型识别威胁信号,并搭建规则引擎,对威胁信号划分,生成高、低两类优先级对应的威胁事件;
特征提取模块,结合NLP技术和命名实体识别技术,从威胁事件中提取特征信息;
威胁分析模块,利用机器学习模型,根据若干已知威胁事件的数据进行训练,机器学习模型根据提取的特征,预测威胁类别;对高优先级的威胁事件进行深度分析,依据深度分析结果执行对应策略;对低优先级的威胁事件进行临时存储;
对高优先级的威胁事件进行深度分析的过程如下:
对每个高优先级的威胁事件进行威胁严重程度评估,获取每个高优先级威胁事件的评估参数数据集,并对评估参数数据进行无量纲化处理,生成每个高优先级威胁事件所对应的威胁程度预估值,对威胁程度预估值超过预设标准阈值的高优先级威胁事件发出预警信号;并按照时间顺序,于预定时间周期T内,在时间线上标记高优先级威胁事件所对应的时间点,而后采用滑动窗口算法结合预设的密度阈值,以识别出威胁事件密度超过密度阈值的时间段,根据对时间段的分析结果触发关注机制;
识别出威胁事件密度超过密度阈值的时间段的过程如下:
时间线标记:将高优先级威胁事件按照时间顺序标记在时间线上;
滑动窗口算法:采用滑动窗口算法来计算每个时间段内的高优先级威胁事件密度;
密度阈值:设定高优先级威胁事件密度的密度阈值,即每小时三个事件;
识别高密度时间段:滑动窗口在时间线上移动,计算每个窗口内的高优先级威胁事件数量,并与密度阈值比较,识别出高优先级威胁事件密度超过密度阈值的时间段;
若干高密度时间段的处理:当识别出M个高密度时间段时,则对每个时间段内的高优先级威胁事件进行威胁程度预估值求平均,得到平均值;
根据对时间段的分析结果触发关注机制,当M的取值为1时,则在下一时间周期T内,对该高密度时间段进行关注;当M的取值超过1时,则对比每个高密度时间段对应的平均值,在下一时间周期T内,不同高密度时间段的关注优先级与对应平均值的大小成正相关,对某一平均值最大的对应高密度时间段进行最先关注;
依据深度分析结果执行对应策略的过程如下:
对威胁程度预估值超过预设标准阈值的高优先级威胁事件发出预警信号时,提醒网络安全工作人员进行应对;在关注的过程中若发现问题或威胁,也立即提醒安全工作人员进行应对;
评估参数数据集包括关键词数量、威胁复杂度以及威胁事件发生时间与当前时间的差值;威胁复杂度的获取过程为:二次搭建规则引擎,从提取的特征信息中抽取目标、攻击方法以及攻击者,并定义为关键因素,并赋予每个关键因素对应的权重和分值,且权重和分值保持同步;
目标:核心系统,赋予权重3>普通系统,赋予权重2>网络,赋予权重1;
攻击方法:零日漏洞,赋予权重3>已知漏洞,赋予权重2>端口扫描,赋予权重1;
攻击者:已知黑客组织,赋予权重3>未知组织,赋予权重2>个人攻击,赋予权重1;
将每个因素的分值乘以其权重,再将所有结果相加,即可得到威胁复杂度;
生成每个高优先级威胁事件所对应威胁程度预估值,所依据的公式如下:式中,Gw表示威胁程度预估值,s表示关键词数量,tc表示威胁复杂度, 表示时间衰减因子,ch表示威胁事件发生时间与当前时间的差值,G表示时间常数;
情报生成模块,生成可读的威胁情报报告。
2.根据权利要求1所述的一种自然语言威胁情报抽取分析系统,其特征在于:数据采集技术包括爬虫技术、API技术、订阅以及平台共享,网络安全数据的来源包括:安全博客和论坛、黑客论坛、新闻媒体、社交媒体以及漏洞数据库。
3.根据权利要求2所述的一种自然语言威胁情报抽取分析系统,其特征在于:对网络安全数据进行预处理的过程包括:清洗、分词、词性标注、命名实体识别以及语义分析。
4.根据权利要求3所述的一种自然语言威胁情报抽取分析系统,其特征在于:轻量级NLP模型采用关键词匹配技术,使用预先定义的关键词库进行匹配;
关键词库:预先定义包含攻击相关关键词和短语的库;关键攻击关键词:标识强烈的攻击意图,包括但不限于:"exploit","malware","ransomware"以及"botnet";非关键攻击关键词:标识潜在的攻击意图,包括但不限于: "scan","probe","injection"以及"bypass";
搭建的规则引擎中,匹配定义如下:
高优先级:数据中包含至少2个关键攻击关键词,或者包含1个关键攻击关键词且至少1个非关键攻击关键词;低优先级:数据中包含1个关键攻击关键词且没有非关键攻击关键词,或者仅包含非关键攻击关键词。
5.根据权利要求4所述的一种自然语言威胁情报抽取分析系统,其特征在于:从威胁事件中提取的特征信息包括:时间、地点、攻击者、目标、攻击方法、漏洞以及工具。
6.根据权利要求5所述的一种自然语言威胁情报抽取分析系统,其特征在于:使用机器学习模型进行威胁类型预测的过程如下:数据准备:收集已知威胁事件的数据;将数据进行处理,对文本数据进行分词、词干提取,转化成数字特征;对特征向量进行标准化处理,将数值特征归一化到0到1之间;
特征工程:选择特征信息进行特征组合,构建新的特征;
通过特征选择方法筛选出所需特征;
模型选择:选择支持向量机作为机器学习模型;
模型训练:将准备好的数据分成训练集和测试集;使用训练集对所选模型进行训练;
模型评估:使用测试集对训练好的模型进行评估,根据评估结果,选择最佳的模型;
预测:使用训练好的模型,对新的威胁事件描述进行预测,得到威胁类型。
7.一种自然语言威胁情报抽取分析方法,使用权利要求1至6中的任一种所述系统,其特征在于:包括如下步骤:S1、采用数据采集技术,获取网络安全数据;
S2、对网络安全数据进行预处理;
S3、对经过预处理的网络安全数据进行初步威胁识别,利用轻量级NLP模型识别威胁信号,并搭建规则引擎,对威胁信号划分,生成高、低两类优先级对应的威胁事件;
S4、结合NLP技术和命名实体识别技术,从威胁事件中提取特征信息;
S5、利用机器学习模型,根据若干已知威胁事件的数据进行训练,机器学习模型根据提取的特征,预测威胁类别;对高优先级的威胁事件进行深度分析,依据深度分析结果执行对应策略;对低优先级的威胁事件进行临时存储;
对高优先级的威胁事件进行深度分析的过程如下:
对每个高优先级的威胁事件进行威胁严重程度评估,获取每个高优先级威胁事件的评估参数数据集,并对评估参数数据进行无量纲化处理,生成每个高优先级威胁事件所对应的威胁程度预估值,对威胁程度预估值超过预设标准阈值的高优先级威胁事件发出预警信号;并按照时间顺序,于预定时间周期T内,在时间线上标记高优先级威胁事件所对应的时间点,而后采用滑动窗口算法结合预设的密度阈值,以识别出威胁事件密度超过密度阈值的时间段,根据对时间段的分析结果触发关注机制;
识别出威胁事件密度超过密度阈值的时间段的过程如下:
时间线标记:将高优先级威胁事件按照时间顺序标记在时间线上;
滑动窗口算法:采用滑动窗口算法来计算每个时间段内的高优先级威胁事件密度;
密度阈值:设定高优先级威胁事件密度的密度阈值,即每小时三个事件;
识别高密度时间段:滑动窗口在时间线上移动,计算每个窗口内的高优先级威胁事件数量,并与密度阈值比较,识别出高优先级威胁事件密度超过密度阈值的时间段;
若干高密度时间段的处理:当识别出M个高密度时间段时,则对每个时间段内的高优先级威胁事件进行威胁程度预估值求平均,得到平均值;
根据对时间段的分析结果触发关注机制,当M的取值为1时,则在下一时间周期T内,对该高密度时间段进行关注;当M的取值超过1时,则对比每个高密度时间段对应的平均值,在下一时间周期T内,不同高密度时间段的关注优先级与对应平均值的大小成正相关,对某一平均值最大的对应高密度时间段进行最先关注;
依据深度分析结果执行对应策略的过程如下:
对威胁程度预估值超过预设标准阈值的高优先级威胁事件发出预警信号时,提醒网络安全工作人员进行应对;在关注的过程中若发现问题或威胁,也立即提醒安全工作人员进行应对;
评估参数数据集包括关键词数量、威胁复杂度以及威胁事件发生时间与当前时间的差值;威胁复杂度的获取过程为:二次搭建规则引擎,从提取的特征信息中抽取目标、攻击方法以及攻击者,并定义为关键因素,并赋予每个关键因素对应的权重和分值,且权重和分值保持同步;
目标:核心系统,赋予权重3>普通系统,赋予权重2>网络,赋予权重1;
攻击方法:零日漏洞,赋予权重3>已知漏洞,赋予权重2>端口扫描,赋予权重1;
攻击者:已知黑客组织,赋予权重3>未知组织,赋予权重2>个人攻击,赋予权重1;
将每个因素的分值乘以其权重,再将所有结果相加,即可得到威胁复杂度;
生成每个高优先级威胁事件所对应威胁程度预估值,所依据的公式如下:式中,Gw表示威胁程度预估值,s表示关键词数量,tc表示威胁复杂度, 表示时间衰减因子,ch表示威胁事件发生时间与当前时间的差值,G表示时间常数;
S6、生成可读的威胁情报报告。