1.一种基于多智能体强化学习的通信网络智能管理系统,其特征在于,包括:通信协议模块、状态感知模块、数据存储和分析模块、智能体模块、自动化决策模块和资源管理模块;
通信协议模块、状态感知模块、数据存储和分析模块、智能体模块、自动化决策模块和资源管理模块依次电性连接,资源管理模块与智能体模块电性连接;
其中通信协议模块,用于根据网络环境和性能要求定义并管理各智能体之间的通信标准和规则,包括身份验证、同步机制和数据加密;
状态感知模块,用于基于传感器实时收集网络设备的网络流量数据,该数据包括带宽利用率、延迟、丢包率、设备温度和功耗,并对网络进行异常检测,提供预警信息;
数据存储和分析模块,用于对状态感知模块中的网络流量数据进行清洗、预处理和存储,得到预处理后的网络流量数据;
智能体模块,用于基于预处理后的网络流量数据,利用深度神经网络和强化学习模型获取时间特征和最优流量调整策略,并基于决策效果数据对该策略进行更新;
自动化决策模块,用于基于智能体模块的结果,生成网络管理决策,根据该决策自动调整网络配置、优化资源分配和预防潜在故障;
资源管理模块,用于根据自动化决策模块和智能体模块的结果,动态调整网络资源的配置,包括带宽分配、路由选择和设备调度。
2.根据权利要求1所述的基于多智能体强化学习的通信网络智能管理系统,其特征在于,通信协议模块被配置以执行以下动作:步骤1、利用安全协议技术,对智能体提供的证书或密钥进行身份验证,验证成功后进行信息交互;
步骤2、通过信息交互,建立同步机制获取智能体之间的数据包并进行解析,该数据包包括时间戳和版本信息,时间戳用于标识数据包的发送时间点,版本信息用于指示数据的更新状态和版本号,对数据信息进行排序和整合,同步智能体之间的时序和状态,并对数据包进行加密处理;
步骤3、采用循环冗余校验技术对数据包的完整性进行校验,若校验结果反馈正常,则不进行任何操作,反之则发送数据包重传指令,直至校验结果反馈正常。
3.根据权利要求2所述的基于多智能体强化学习的通信网络智能管理系统,其特征在于,步骤3中,校验包括以下内容:将循环冗余校验寄存器初始化为0,将数据的每一位与循环冗余校验寄存器的当前值进行异或操作,并将结果左移一位,若左移后的最高位是1,则将该值与多项式进行异或操作,得到最终的循环冗余校验校验码,将最终的循环冗余校验校验码附加到原始数据的末尾一并发送到接收端;计算原始数据的循环冗余校验值和接收端接收到的数据的循环冗余校验值,若两者相同,则校验通过,反之则校验不通过;
CRC值的计算公式为:
其中,M(x)表示原始信息多项式,x表示形式变量,n表示循环冗余校验校验码的总位数,k表示原始数据的位数,G(x)表示生成多项式,Q(x)表示两个多项式的商,R(x)表示余数多项式。
4.根据权利要求1所述的基于多智能体强化学习的通信网络智能管理系统,其特征在于,数据存储和分析模块被配置以执行以下动作:对状态感知模块中的网络流量数据进行清洗,去除噪声和异常值,并将清洗后的数据转换为时间序列数据;对清洗后的数据进行数据压缩、归一化和特征提取,得到预处理后的网络流量数据。
5.根据权利要求1所述的基于多智能体强化学习的通信网络智能管理系统,其特征在于,智能体模块被配置以执行以下动作:步骤1、基于深度神经网络构建流量模式分析模型,将预处理后的数据输入到该模型中,提取时间特征;使用历史网络流量数据训练流量模式分析模型,通过均方误差作为损失函数度量预测误差;将预处理后的数据输入到训练完成的流量模式分析模型中,得到预测的流量高峰;
步骤2、基于实时状态和历史经验,利用强化学习模型选择最优动作,调整流量分配规则;
步骤3、通过基于事件的触发机制收集决策效果数据,根据反馈结果更新策略;其中,事件包括时间周期性事件、流量阈值事件、性能指标异常事件和外部触发事件,决策效果数据包括决策执行前后的网络流量情况、网络性能指标和用户的网络性能变化的感知和反馈;
通过比较决策执行前后的性能指标和分析流量模式的变化,对决策效果进行评估。
6.根据权利要求5所述的基于多智能体强化学习的通信网络智能管理系统,其特征在于,步骤2中,调整流量分配规则包括以下子步骤:步骤201、将通信网络抽象为强化学习环境,其中实时状态由网络状态和时间特征组成,奖励函数为优化网络性能的度量;
步骤202、初始化网络参数,并设置两个相同的网络结构,一个用于在线预测,另一个用于稳定目标值;将网络状态输入到强化学习模型中,输出每个动作的预期Q值;执行流量调整策略、观察状态转换和获得的奖励,并存储到经验回放池;从经验回放池中随机抽取一批经验训练强化学习模型;对于每批经验,使用训练完成的强化学习模型预测当前状态的Q值,并使用目标网络预测下一状态的Q值以计算目标Q值;通过最小化预测Q值与目标Q值之间的误差来更新训练完成的强化学习模型的参数,并定期将训练完成的强化学习模型的参数复制到目标网络;根据当前网络状态和步骤1中提取的时间特征,通过训练完成的强化学习模型预测每个动作的Q值,选择具有最高Q值的动作为最优流量调整策略。
7.根据权利要求5所述的基于多智能体强化学习的通信网络智能管理系统,其特征在于,步骤3中,决策效果评估的计算公式为:计算性能差异的公式为:
text差异值=决策后指标值‑决策前指标值
计算性能改善百分比的公式为:
计算性能恶化百分比的公式为:
计算用户满意度评分的公式为:
其中,A表示参与反馈的用户总数。