利索能及
我要发布
收藏
专利号: 202510451910X
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.基于多智体强化学习的VR视频自适应码率控制方法,其特征在于,包括:

获取历史视频块传输数据并采用预测带宽,构建网络延迟特征向量评估网络稳定性,基于预测带宽和缓冲区状态建立码率切换影响模型,通过缓冲区状态转移方程进行阈值控制,结合视频流带宽份额动态调整,基于质量评分、切换影响及网络稳定性选择最优码率;

基于网络延迟特征向量构建包含缓冲区状态及视频质量状态的特征向量,将特征向量输入多层感知机结构的Actor网络,通过ReLU激活函数和Softmax函数输出码率选择概率分布,基于视频质量、缓冲区状态及切换平滑度构建综合奖励函数,结合经验池批量采样确定码率级别;

对视频块计算结构相似度获取质量映射值,基于下载时间和缓冲区状态计算重缓冲指标,结合质量差异和时间衰减权重评估质量变化,采集视口位置信息计算平滑度和预测误差,依据视场角覆盖率和空间质量分布确定视频沉浸度,将指标构建综合奖励函数并归一化,基于折扣因子计算累积奖励并优化权重系数;

构建多智能体联合状态向量获取局部观测信息,利用时序差分目标优化Critic网络的均方误差损失,结合策略梯度和熵正则更新Actor网络,采用同构智能体参数共享和异构智能体独立更新机制,通过注意力权重整合群体观测信息;

在经验池中持续存储状态向量交互数据,利用多层感知机提取网络特征,基于特征向量构建自适应奖励函数,采用策略梯度方法和Adam优化器更新网络参数,根据体验质量差值调整奖励权重,从经验池采样持续优化码率选择策略;

获取视频传输过程中过去k个视频块的吞吐量数据和下载时间数据,其中吞吐量数据为每个视频块的大小与对应下载时间的比值;采用指数衰减权重对吞吐量数据进行加权计算得到加权预测带宽,其中指数衰减权重随时间衰减程度由衰减系数确定,衰减系数用于调节历史数据对带宽预测的影响程度;

基于下载时间数据构建网络延迟特征向量,计算网络延迟特征向量的方差值作为网络稳定性量化指标,方差值越大表明网络稳定性越差;基于加权预测带宽,结合当前缓冲区大小、不同码率对应的下一视频块预计大小信息以及当前码率,建立码率切换影响评估模型,码率切换影响评估模型用于评估码率切换对系统性能的影响程度;

根据当前缓冲区大小、加权预测带宽以及视频块时长构建缓冲区状态转移方程,设定缓冲区安全阈值,当缓冲区状态转移方程预测的下一时刻缓冲区大小小于缓冲区安全阈值时,基于加权预测带宽选择保守码率;

在检测到存在多个视频流时,获取每个视频流的目标码率,计算每个视频流的带宽份额因子,带宽份额因子为对应视频流的目标码率占所有视频流目标码率总和的比例,基于带宽份额因子对加权预测带宽进行调整得到调整后带宽;

将视频质量评分、码率切换影响评估模型的评估结果及方差值构建优化目标函数,通过设定平衡因子调节各评价指标的权重,基于调整后带宽,从预设码率集合中选择使优化目标函数取得最优值的码率作为最终码率决策结果。

2.根据权利要求1的方法,其特征在于,基于网络延迟特征向量构建包含缓冲区状态及视频质量状态的状态特征向量,将特征向量输入多层感知机结构的Actor网络,通过ReLU激活函数和Softmax函数输出码率选择概率分布,基于视频质量、缓冲区状态及切换平滑度构建综合奖励函数,结合经验池批量采样确定码率级别包括:构建状态特征向量,状态特征向量包括缓冲区状态及视频质量状态,缓冲区状态包括当前缓冲区大小及缓冲区安全阈值,视频质量状态包括当前码率级别及码率切换幅度;将状态特征向量输入Actor网络,Actor网络采用多层感知机结构,包括第一隐藏层和第二隐藏层,第一隐藏层及第二隐藏层均采用ReLU激活函数;

基于当前码率级别、当前缓冲区大小及码率切换幅度构建综合奖励函数,综合奖励函数包括视频质量奖励、缓冲区状态奖励及切换平滑度奖励,其中视频质量奖励为当前码率级别与最大码率级别的比值的加权值,缓冲区状态奖励为当前缓冲区大小与缓冲区安全阈值的比值计算结果的加权值,切换平滑度奖励为码率切换幅度与最大码率级别的比值的归一化加权值;根据综合奖励函数计算策略梯度,利用策略梯度通过梯度下降法对Actor网络的网络参数进行迭代优化得到优化后的网络参数;

将状态特征向量、基于码率选择概率分布确定的动作、综合奖励函数的计算结果及下一状态特征向量构建为转移样本存入经验池,基于预设采样大小从经验池中进行批量采样,结合探索策略对优化后的网络参数进行更新;将更新后的网络参数输入Actor网络,基于Actor网络输出的码率选择概率分布确定最终的码率级别。

3.根据权利要求1的方法,其特征在于,对视频块计算结构相似度获取质量映射值,基于下载时间和缓冲区状态计算重缓冲指标,结合质量差异和时间衰减权重评估质量变化,采集视口位置信息计算平滑度和预测误差,依据视场角覆盖率和空间质量分布确定视频沉浸度,将指标构建综合奖励函数并归一化,基于折扣因子计算累积奖励并优化权重系数包括:获取视频块码率和视频块图像数据,基于视频块图像数据的均值、标准差及协方差计算结构相似度,将视频块码率与结构相似度映射得到质量映射值;

监测视频块下载过程,获取每个视频块的下载时间及对应的缓冲区剩余时长,当下载时间大于缓冲区剩余时长时累积计算重缓冲时长,并基于重缓冲发生次数与总播放时长计算重缓冲频率;获取相邻视频块的质量映射值计算质量差异,构建时间衰减权重序列,将质量差异与时间衰减权重序列的加权和作为质量变化评估指标;

实时采集用户视口位置信息,提取用户视口位置信息中的方位角和俯仰角,计算相邻时刻方位角和俯仰角的欧氏距离得到视口平滑度,基于视口位置预测值与实际值的偏差距离计算视口预测误差;

计算视频画面中视场区域面积与视场总面积的比值得到视场角覆盖率,同时对视场空间进行划分并为各区域分配空间权重,将各区域的质量映射值与对应空间权重的加权和作为视频沉浸度;

将质量映射值、重缓冲时长、质量变化评估指标、视口平滑度、视口预测误差及视频沉浸度进行线性组合构建综合奖励函数,并对综合奖励函数进行最大最小值归一化处理得到归一化奖励值;

基于预设的折扣因子计算累积折扣奖励,累积折扣奖励为各时刻的归一化奖励值乘以对应时间步长的指数衰减系数后的加权和;采用梯度上升法迭代优化综合奖励函数中各评价指标的权重系数,在权重系数和为1且各系数非负的约束下,通过最大化累积折扣奖励的期望值确定最优权重系数组合。

4.根据权利要求1的方法,其特征在于,构建多智能体联合状态向量获取局部观测信息,利用时序差分目标优化Critic网络的均方误差损失,结合策略梯度和熵正则更新Actor网络,采用同构智能体参数共享和异构智能体独立更新机制,通过注意力权重整合群体观测信息,基于全局经验池数据同步更新网络参数实现协同学习包括:构建多智能联合状态向量,多智能联合状态向量包含所有智能体的状态信息,并通过观测函数将多智能联合状态向量映射为每个智能体的局部观测信息;

基于每个智能体的局部观测信息,利用对应的策略函数独立生成动作,并将多智能联合状态向量、动作、当前时刻获得的奖励值及转移后的下一状态信息记录为状态转移元组存入经验池;

当经验池中的数据量达到预设存储阈值时,从经验池中随机采样批次数据,并基于批次数据中的奖励值和目标网络对下一状态的评估值计算时序差分目标;利用时序差分目标与critic网络对当前状态动作组合的预测值构建均方误差损失函数,基于均方误差损失函数的梯度方向更新critic网络的参数;

将critic网络的评估状态的动作值函数与策略函数的对数概率相乘计算策略梯度,并在策略梯度中引入策略熵正则项,基于最终的梯度方向更新actor网络参数;识别系统中的同构智能体,对同构智能体采用参数共享机制统一更新网络参数,同时保持异构智能体的参数独立更新;

根据异构智能体间的观测信息相似度计算注意力权重,利用注意力权重对其他智能体的观测信息进行加权整合,得到包含群体信息的增强观测表示;将所有智能体的经验数据合并至全局经验池,基于全局经验池中的数据计算整体梯度,并通过整体梯度同步更新全局网络参数,实现多智能体的协同学习。

5.根据权利要求1的方法,其特征在于,在经验池中持续存储状态向量交互数据,利用多层感知机提取网络特征,基于特征向量构建自适应奖励函数,采用策略梯度方法和Adam优化器更新网络参数,根据体验质量差值调整奖励权重,从经验池采样持续优化码率选择策略包括:构建经验池存储状态向量交互数据,状态向量交互数据包含状态向量和码率决策;基于状态向量利用多层感知机提取网络特征,通过ReLU激活函数对状态向量进行非线性变换得到特征向量;根据特征向量构建自适应奖励函数,自适应奖励函数通过对码率质量评分、缓冲区抖动程度及相邻的码率决策的变化幅度进行加权计算得到,加权计算采用动态调整的权重系数;

基于特征向量构建码率选择策略网络,采用策略梯度方法计算码率选择策略网络的参数梯度,参数梯度通过策略函数对数与状态动作值函数的乘积期望值获得;引入Adam优化器对码率选择策略网络进行参数更新,Adam优化器基于一阶动量估计与二阶动量估计计算自适应学习率,并利用自适应学习率更新策略网络参数;

计算目标体验质量与当前体验质量的差值,基于差值动态调整自适应奖励函数中的权重系数,通过预设步长实现权重系数的自适应更新;在视频流传输过程中,持续从经验池中随机采样批次数据,利用批次数据不断优化码率选择策略。