1.一种基于深度强化学习的群智感知激励机制方法,其特征在于:所述方法包括以下步骤:步骤1:设置激励周期T;
步骤2:获取每个激励周期T的初始状态下参与者的移动轨迹,包括以下步骤:步骤2.1:根据感知区域的大小将感知区域划分成a×b的网格系统;
步骤2.2:将激励周期T划分成长度为t的时间间隔;
步骤2.3:每隔时间t,通过群智感知参与者携带的智能设备GPS传感器获取参与者的位置,获取每个参与者当前所处位置的经纬度信息,并转换至a×b的网格系统的坐标系中,以坐标(i,j)表示,1≤i≤a,1≤j≤b;
步骤2.5:根据坐标信息,得到每个参与者在激励周期T内的移动轨迹;
步骤3:基于深度强化学习,以初始状态下参与者的移动轨迹预测参与者当前激励周期内的移动轨迹,获得当前激励周期结束时参与者的预测位置;
步骤4:根据当前激励周期结束时参与者的预测位置,获得数据请求方提供的感知数据目标分布,选择合适参与者进行激励;
步骤5:计算当前激励周期结束时参与者实际位置分布与感知数据目标分布的相对熵与当前激励周期内需要的激励成本,基于计算结果调整激励周期T,包括以下步骤:步骤5.1:统计当前激励周期内激励的参与者人数;
步骤5.2:根据激励的参与者人数计算需要支付的激励成本;
步骤5.3:计算当前激励周期结束时参与者实际位置分布与感知数据目标分布的相对熵;
步骤5.4:根据激励成本和相对熵调整激励周期T。
2.根据权利要求1所述的一种基于深度强化学习的群智感知激励机制方法,其特征在于:所述深度强化学习为改进的DDPG算法。
3.根据权利要求2所述的一种基于深度强化学习的群智感知激励机制方法,其特征在于:所述步骤3包括以下步骤:步骤3.1:初始化改进的DDPG算法中的Critic和Actor两部分神经网络;
步骤3.2:初始化记忆库replay buffer;
步骤3.3:生成参与者移动轨迹经验数据,存入记忆库replay buffer;
步骤3.4:从记忆库replay buffer中随机采取样本数据进行训练;
步骤3.5:输出DDPG算法预测参与者下个激励周期的移动轨迹;
步骤3.6:得到参与者当前激励周期结束时的预测位置分布。
4.根据权利要求3所述的一种基于深度强化学习的群智感知激励机制方法,其特征在于:所述步骤3.1中,Critic部分中的神经网络为 和 Actor部μ
分中的神经网络为μ(si|θ),对应的Target网络为 和μ′μ′
(si|θ );其中,si代表参与者上一次移动状态,si+1代表下一移动状态,a代表移动方向,μ μ′θ,θ 分别代表这六个网络的权重参数。
5.根据权利要求3所述的一种基于深度强化学习的群智感知激励机制方法,其特征在于:所述步骤3.3包括以下步骤:步骤3.3.1:初始化随机噪声N,对训练过程产生扰动;
步骤3.3.2:获取参与者当前移动状态st;
步骤3.3.3:将st和噪声N放入策略函数,得到下一步移动方向at;
步骤3.3.4:执行at,得到奖励rt和下一步参与者移动状态st+1;
步骤3.3.5:将(st,at,rt,st+1)存入记忆库replay buffer。
6.根据权利要求5所述的一种基于深度强化学习的群智感知激励机制方法,其特征在μ于:所述步骤3.3.3中,策略函数为at=μ(st|θ)+N。
7.根据权利要求4所述的一种基于深度强化学习的群智感知激励机制方法,其特征在于:所述步骤3.4包括以下步骤:步骤3.4.1:从记忆库replay buffer中随机抽取数据(si,ai,ri,si+1);步骤3.4.2:分别将Q1′和Q2′的参数代入贝尔曼方程,处理所述抽取数据,选择值较小的结果作为训练数据标μ′ Q′签值,得到训练数据标签值yi=ri+γQ′(si+1,μ′(si+1|θ )|θ )min,其中,ri代表参与者到达μ′ Q′特定移动状态的奖励值,γ代表学习率,Q′(si+1,μ′(si+1|θ )|θ )min代表Critic部分对应的两个target网络计算结果中的较小值;
步骤3.4.3:训练抽取数据,反向传递误差更新critic network参数;
步骤3.4.4:通过梯度反向传播更新actor network参数μ;
步骤3.4.5:更新Critic和Actor部分的target network参数。
8.根据权利要求1所述的一种基于深度强化学习的群智感知激励机制方法,其特征在于:所述步骤4包括以下步骤:步骤4.1:获取数据请求方提供的感知数据目标分布;
步骤4.2:计算预测出的参与者位置分布与感知数据目标分布的相对熵;
步骤4.3:设置相对熵阈值,选择感知区域内相对熵大于阈值区域的参与者进行激励,否则不进行激励。