利索能及
我要发布
收藏
专利号: 2022110545574
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于深度强化学习的攻击树蜜罐部署防御方法,其特征在于,具体包括以下步骤:S1,获取网络拓扑信息,并依次构建攻击树;所述攻击树用于渗透路径寻优;

S2,将卷积神经网络与Q‑Learning算法结合以创建DQN模型,基于DQN模型训练智能体,其中所述智能体作为渗透攻击方,训练目标为生成当前最优渗透攻击路径;将渗透路径寻优过程构建为MDP过程,利用DQN算法进行训练,状态输入为每个节点的漏洞信息,奖励根据CVSS对不同漏洞的基础得分和期望得分进行设定,动作输出即DQN模型所选择的攻击路径;

S3,将SDN流量控制器与攻击树结合,根据步骤S2得到的当前最优渗透攻击路径,将当前最优攻击路径所经历的所有节点均作为可能受到攻击的节点,通过监测每个可能受到攻击的节点的流量变化情况,确定易受攻击的节点;基于访问矩阵、访问复杂度、真实性指标计算每个易受攻击的节点对应的攻击漏洞的难度;依据易受攻击的节点的流量变化情况和攻击漏洞的难度从而得到攻击概率最大的节点,并在该节点部署蜜罐;并不断更新蜜罐的部署,引诱使攻击者陷入部署好的蜜罐,从而完成防御。

2.根据权利要求1所述的基于深度强化学习的攻击树蜜罐部署防御方法,其特征在于,所述步骤S1中获取网络拓扑信息包括:利用漏洞扫描工具Shodan对目标网络系统进行端口扫描,从而获得每台设备的IP 地址、每台设备的操作系统类型,每个IP地址所开放的端口、每个端口正在运行的服务列表,每个端口采用的通信协议,不同子网之间的通信关系在内的用于构建真实网络拓扑的关键信息。

3.根据权利要求1所述的基于深度强化学习的攻击树蜜罐部署防御方法,其特征在于,所述步骤S1中构建攻击树的过程具体为:基于获取的网络拓扑信息,通过MulVAL生成攻击树;其中,所述攻击树包含了网络拓扑节点的所有信息;所述网络拓扑节点的所有信息包括该节点的漏洞以及根据漏洞利用关系可执行的操作;所述可执行的操作包括渗透攻击、横向移动、获得用户权限并进一步提升至Root权限。

4.根据权利要求1所述的基于深度强化学习的攻击树蜜罐部署防御方法,其特征在于,所述步骤S2中基于DQN模型训练智能体的过程具体为:S201,DQN模型中当前网络的参数 是实时更新的,每隔N轮迭代后,将当前网络的参数复制到目标网络中,然后通过最小化当前 值和目标 值之间的均方误差来更新网络参数, 均方误差函数为:;

其中, ,r表示DQN模型的即时奖励;

按照如下公式计算网络梯度,更新当前网络的参数 :

S202,将攻击树每个网络拓扑节点对应的漏洞服务,漏洞属性以及漏洞类型转换成简化矩阵作为步骤S2训练好的DQN模型的状态输入;根据贝尔曼最优方程理论,只要通过不断迭代更新步骤S201,使得目标 值与当前 值无限接近,从而最终完成训练,得到训练目标即生成当前最优渗透攻击路径:。

5.根据权利要求4所述的基于深度强化学习的攻击树蜜罐部署防御方法,其特征在于,DQN模型的即时奖励r的计算过程具体为:结合通用漏洞评分系统对攻击树每个网络拓扑节点对应的漏洞的基础评分和渗透可行性评分两项指标对成功渗透不同节点的不同漏洞给予奖励,DQN模型的即时奖励r即奖励得分 设置为:;

其中, 表示基础得分, 表示渗透可行性评分。

6.根据权利要求1所述的基于深度强化学习的攻击树蜜罐部署防御方法,其特征在于,所述步骤S3具体包括以下步骤:S301,根据步骤S2训练得到的当前最优攻击路径,当前最优攻击路径所经历的所有节点均为可能受到攻击的节点,对可能受到攻击的节点进行筛选得到易受攻击的节点;

S302,根据的攻击树中每个节点对应的漏洞信息并结合CVSS漏洞评分系统的三个指标对该漏洞的脆弱性进行评分,分别为访问矩阵AV、访问复杂度AC及真实性AU,三个指标的范围均为 ,并将上述三个指标分别记为V,C,U;

S303,根据步骤S302得到的V,C,U指标计算攻击漏洞的难度 ,计算公式如下:;

S304,将步骤S301得到的易受攻击的节点对应的流量变化与其漏洞脆弱性分析相结合,从而得到攻击概率最大的节点,并在该节点部署蜜罐;

S305,在智能部署蜜罐的防御过程中,若智能体陷入步骤S304事先部署好的蜜罐则给予正奖励 ,若未陷入蜜罐则给予负奖励 ;

 S306,将状态转换过程存储在经验回放经验缓冲池,作为DQN模型的训练数据集;从经验缓冲池中采样 个训练数据集,对DQN模型中的当前 网络和目标 网络进行更新训练;

S307,重复步骤S301 S306对DQN模型的训练过程,不断更新蜜罐的部署,并引诱使渗~透攻击者陷入部署好的蜜罐,从而达到防御渗透攻击的目的。

7.根据权利要求6所述的基于深度强化学习的攻击树蜜罐部署防御方法,其特征在于,所述步骤S301包括:对可能受到攻击的节点进行筛选的过程:将生成的攻击树与软件定义网络结合,监测每个可能受到攻击的节点的流量变化情况,对每个可能受到攻击的节点计算其当前时刻和下一时刻对应的流量变化矩阵,对当前时刻和下一时刻对应的流量变化矩阵进行维度比较,若所有维度数据变化超过自定义阈值,即可认为该可能受到攻击的节点为易受攻击的节点。

8.根据权利要求6所述的基于深度强化学习的攻击树蜜罐部署防御方法,其特征在于,所述步骤中S305若智能体陷入步骤S304事先部署好的蜜罐则给予正奖励 ,若未陷入蜜罐则给予负奖励 包括:若智能体陷入事先设定好的蜜罐,此时给与智能体步骤S303中设定的 奖励,若未陷入蜜罐而是绕过蜜罐对蜜罐周边主机进行渗透攻击的操作,则给与智能体 的负奖励。

9.一种基于深度强化学习的攻击树蜜罐部署防御装置,其特征在于,包括一个或多个处理器,用于实现权利要求1‑8中任一项所述的基于深度强化学习的攻击树蜜罐部署防御方法。

10.一种计算机可读存储介质,其上存储有程序,其特征在于,该程序被处理器执行时,用于实现权利要求1‑8中任一项所述的基于深度强化学习的攻击树蜜罐部署防御方法。