利索能及
我要发布
收藏
专利号: 202511174543X
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.移动场景下基于信号增强的深度强化学习带宽估计方法,其特征在于,包括:

以预设采样间隔采集信号带宽数据和初始RSSI值;将所述初始RSSI值通过线性映射转换为归一化RSSI值,对所述归一化RSSI值执行滑动窗口均值滤波得到RSSI值;

将所述信号带宽数据构建为网络传输状态特征,将最近多个历史带宽预测样本重塑为时序特征,基于所述RSSI值、所述网络传输状态特征和所述时序特征,构建状态空间;

将所述状态空间输入深度强化学习模型,所述深度强化学习模型采用演员网络‑评论家网络结构,所述演员网络输出带宽预测区间的概率分布,所述评论家网络评估当前状态的长期收益;

计算当前RSSI值与前一时刻RSSI值的差值,当所述差值小于动态阈值时触发带宽保护机制,得到调整后的预测带宽值;将所述调整后的预测带宽值通过实时传输控制协议反馈至发送端,所述发送端根据当前丢包率对发送速率进行自适应调整;

将所述调整后的预测带宽值与最小发送速率作为最终目标码率输出,用于指导网络资源分配。

2.根据权利要求1所述的方法,其特征在于,将所述初始RSSI值通过线性映射转换为归一化RSSI值,对所述归一化RSSI值执行滑动窗口均值滤波得到RSSI值,包括:计算所述归一化RSSI值在滑动时间窗口内的信号波动率,所述信号波动率基于所述归一化RSSI值与窗口均值的方差计算得到;

根据所述信号波动率动态调整所述滑动时间窗口的窗口大小,当所述信号波动率大于波动阈值时将所述窗口大小设置为最小窗口值,当所述信号波动率小于平稳阈值时将所述窗口大小设置为最大窗口值;

对所述滑动时间窗口内的归一化RSSI值执行加权平均滤波,得到RSSI值。

3.根据权利要求1所述的方法,其特征在于,将所述状态空间输入深度强化学习模型,所述深度强化学习模型采用演员网络‑评论家网络结构,所述演员网络输出带宽预测区间的概率分布,所述评论家网络评估当前状态的长期收益,包括:将所述RSSI值输入所述深度强化学习模型的多个全连接层得到深度特征向量;

将所述深度特征向量输入演员网络输出层,所述演员网络输出层包含多个神经元且使用softmax激活函数,得到多维动作概率分布;将带宽预测范围划分为多个预测区间,所述多维动作概率分布中的每个元素分别对应一个预测区间的选择概率;基于所述动作概率分布选择概率最高的带宽预测区间,通过对数线性变换将所述带宽预测区间映射为具体带宽预测值;

将所述深度特征向量输入评论家网络输出层得到状态价值,基于所述状态价值计算时序差分误差;根据所述时序差分误差更新所述演员网络的网络参数。

4.根据权利要求1所述的方法,其特征在于,所述方法还包括:

基于接收速率、数据包延迟、丢包率以及RSSI值构建奖励函数,利用近端策略优化算法训练所述深度强化学习模型,包括:将接收速率进行对数转换得到带宽收益分量,将数据包延迟限制在预设时间范围内得到延迟惩罚分量,将丢包率作为传输质量惩罚分量,计算当前时刻RSSI值与上一时刻RSSI值的偏差,得到信号波动惩罚分量,将所述带宽收益分量、所述延迟惩罚分量、所述传输质量惩罚分量和所述信号波动惩罚分量加权组合得到当前时刻的奖励函数值;

计算演员网络输出的新策略概率与上一轮迭代策略概率的比值得到概率比;将当前时刻至后续多个时刻的奖励函数值与状态价值的差值加权求和得到优势函数值;将所述概率比与所述优势函数值相乘,并加入策略熵惩罚项得到策略损失值;

在演员网络的每层神经元中随机断开连接,形成稀疏网络结构,基于所述策略损失值计算网络参数梯度;使用Adam优化器更新所述稀疏网络结构中的参数,完成一次策略迭代,重复执行策略迭代直至折扣累积奖励收敛。

5.根据权利要求1所述的方法,其特征在于,计算当前RSSI值与前一时刻RSSI值的差值,当所述差值小于动态阈值时触发带宽保护机制,得到调整后的预测带宽值,包括:计算当前时刻RSSI值与前一时刻RSSI值的偏差,取其绝对值作为RSSI差值;获取历史RSSI值的标准差与均值,将所述标准差和所述均值进行加权求和,得到动态阈值;

当所述RSSI差值小于所述动态阈值时,触发带宽保护机制;计算RSSI差值与所述动态阈值的比值,将所述比值取负指数得到带宽因子;将当前预测带宽值和历史带宽均值分别乘以所述带宽因子并求和,得到保护带宽值;

计算所述保护带宽值与所述历史带宽均值的差值绝对值,当所述差值绝对值小于预设调整幅度时,将所述保护带宽值作为调整后的预测带宽值,当所述差值绝对值大于或等于所述预设调整幅度时,将所述历史带宽均值加减所述预设调整幅度作为调整后的预测带宽值。

6.根据权利要求1所述的方法,其特征在于,将所述调整后的预测带宽值通过实时传输控制协议反馈至发送端,所述发送端根据当前丢包率对发送速率进行自适应调整,包括:所述发送端在预设时间窗口内统计丢失数据包数量与总发送数据包数量,将所述丢失数据包数量除以所述总发送数据包数量得到当前时刻丢包率;

根据所述当前时刻丢包率确定丢包等级,当所述当前时刻丢包率大于高丢包阈值时获取下调系数,当所述当前时刻丢包率小于低丢包阈值时获取上调系数,将所述下调系数的补值或所述上调系数加一作为速率调整系数;

将当前传输速率乘以所述速率调整系数得到新发送速率,将所述新发送速率与前一时刻发送速率分别乘以平滑因子与所述平滑因子的补值并相加得到当前时刻平滑后的发送速率;

将所述调整后的预测带宽值乘以网络抖动补偿系数的补值,得到反馈带宽值;将所述当前时刻平滑后的发送速率、所述反馈带宽值、最大速率限制三者取最小值,将所述最小值与最小速率限制取最大值得到最终发送速率。

7.移动场景下基于信号增强的深度强化学习带宽估计系统,用于实现如权利要求1‑6中任一项所述的方法,其特征在于,包括:第一单元,用于以预设采样间隔采集信号带宽数据和初始RSSI值;将所述初始RSSI值通过线性映射转换为归一化RSSI值,对所述归一化RSSI值执行滑动窗口均值滤波得到RSSI值;

第二单元,用于将所述信号带宽数据构建为网络传输状态特征,将最近多个历史带宽预测样本重塑为时序特征,基于所述RSSI值、所述网络传输状态特征和所述时序特征,构建状态空间;

第三单元,用于将所述状态空间输入深度强化学习模型,所述深度强化学习模型采用演员网络‑评论家网络结构,所述演员网络输出带宽预测区间的概率分布,所述评论家网络评估当前状态的长期收益;

第四单元,用于计算当前RSSI值与前一时刻RSSI值的差值,当所述差值小于动态阈值时触发带宽保护机制,得到调整后的预测带宽值;将所述调整后的预测带宽值通过实时传输控制协议反馈至发送端,所述发送端根据当前丢包率对发送速率进行自适应调整;

第五单元,用于将所述调整后的预测带宽值与最小发送速率作为最终目标码率输出,用于指导网络资源分配。

8.一种电子设备,其特征在于,包括:

处理器;

用于存储处理器可执行指令的存储器;

其中,所述处理器被配置为调用所述存储器存储的指令,以执行权利要求1至6中任意一项所述的方法。

9.一种计算机可读存储介质,其上存储有计算机程序指令,其特征在于,所述计算机程序指令被处理器执行时实现权利要求1至6中任意一项所述的方法。