1.一种高海况环境下的无人集群多目标搜索和追捕方法,其特征在于,包括以下步骤:S1、对将要搜索海域使用栅格的形式离散化处理,用栅格法对搜索环境进行建模;
S2、将无人机看作空中二维平面上运动的粒子,基于环境刺激函数的协同覆盖搜索算法,针对每一个无人机进行搜索路径优化,根据无人机状态信息和环境刺激函数,优化出无人机下一个最优航迹点,根据最优航迹点,无人机更新运动状态并移动到相应位置,在每一个时间步长内搜索其范围内栅格,并将感知信息发送给通信无人艇;
S3、当无人机搜索到目标后,跟踪目标,在每一个时间步长中测算自身与目标之间的相对距离、相对距离变化率和相对速度,计算自身与目标的相对定位估计,进一步根据无人机与目标的定位估计,计算追捕无人艇与目标的相对定位估计;
S4、无人机记录目标状态信息并传输给通信无人艇,构建目标赋值矩阵,根据当前目标状态信息和现存追捕无人艇状态信息进行无人艇目标任务分配;
S5、在追捕无人艇分配目标任务的基础上,建立追捕无人艇追捕决策模型和决策学习模型;完成后追捕无人艇执行系统追捕任务;
所述步骤S2中基于环境刺激函数的协同覆盖搜索算法,针对每一个无人机进行搜索路径优化具体步骤如下:S21、初始化无人机的位置和状态,其中在 时刻无人机 的状态信息公式表达如下:;
式中, 表示 时刻无人机 在环境 的位置坐标, 表示 时刻无人机 的航向角;
S22、计算每个栅格的刺激函数 ,在集群搜索过程中,刺激函数 采取以下计算方式进行更新:;
式中, 为 初始刺激值, 为衰减系数,当 被搜索的次数越多,其搜索刺激值越小;
无人机 将会在临近栅格内选择具有最大搜索刺激值的栅格作为下一个搜索点,公式表达如下:;
当无人机 搜索到目标后,无人机记录并计算目标状态,将目标状态发送给同通信组内的通信无人艇,目标状态公式表达为:;
式中, 表示 时刻目标 在环境 的位置坐标, 表示目标 速度, 表示目标 相对于无人机 的偏向角。
2.根据权利要求1所述一种高海况环境下的无人集群多目标搜索和追捕方法,其特征在于,步骤S1中将整个环境视为一个平面矩形区域,并且区域被划分为 离散的栅格,用表示矩形的第 行和第 列栅格, 和 分别表示单位栅格的长度和宽度,整个搜索环境 用栅格集公式表达如下:;
在 时刻, 的状态表示为:
;
式中, 表示 中心点的坐标, 表示 是否存在目标,其中表示 内存在搜索目标, 表示 内不存在目标,表示 到 时刻为止被搜索的次数, 为搜索刺激函数,表示对无人机的吸引程度。
3.根据权利要求1所述一种高海况环境下的无人集群多目标搜索和追捕方法,其特征在于,步骤S3中,当无人机搜索到目标后,无人机采用超宽带测距和视觉里程计测速,实时测量每个时间步长下无人机和无人艇之间的相对距离 和相对速度 ,根据测量数据,给出第 个时间步长下,无人机 和目标 之间的相对定位估计公式表达如下:;
式中, 表示相对距离变化率, 、 和 分别是相对速度 、相对距离 以及相对距离变化率 分别在第 个时间步长的测量误差; 是超宽带传感器的采样周期,是可谐调恒定增益;
根据集群内给出的追击无人艇和无人机的状态信息,获得追击无人艇 和无人机 的相对距离 、相对速度 和相对距离变化率 ,进而计算出每一个追捕无人艇和目标的相对距离 、相对速度 和相对距离变化率 ;
计算出同一时间步长下,追捕无人艇 和目标 的相对定位估计公式表达如下:。
4.根据权利要求1所述一种高海况环境下的无人集群多目标搜索和追捕方法,其特征在于,步骤S4中,共有 艘追捕无人艇对 个目标进行追捕,其中 ,设置目标分配矩阵,当 时,表示目标 被分配给追击无人艇 ,当 时,表示目标 没有被分配给追击无人艇 ,在目标分配中,每一个目标应该分配至少一艘追击无人艇,即 ,此外,所有追击无人艇最终应该都进行追捕任务,即 ;
以无人艇和目标初始相对距离最小化为分配目标建立目标分配模型表达如下:;
式中, 表示追捕无人艇和目标的初始相对距离,各追捕无人艇计算出自身与此目标的匹配程度,并让匹配程度最高的无人艇进行追捕任务。
5.根据权利要求1所述一种高海况环境下的无人集群多目标搜索和追捕方法,其特征在于,步骤S5中建立追捕无人艇目标追捕模型,该模型用元组表示如下:;
式中, 表示当前追捕的状态空间,它是可以被集群内所有设备共享的, 表示追捕无人艇 的动作空间, 表示环境的确定性传递函数, 表示追捕无人艇的奖励函数;
追捕无人艇编队的全局奖励值定义为各追捕无人艇奖励值的平均值,公式表达如下:;
式中, 表示在状态 下,时刻追捕无人艇编队获得的奖励值;
极大策略公式表达如下:
;
式中, 表示 时刻的状态;
设置每个追捕无人艇奖励值,公式表达如下:;
式中, 表示当追捕无人艇与目标的距离小于追捕距离,即追捕无人艇追捕到目标时获得的捕获奖励, 表示当同一个目标存在多个追捕无人艇进行追捕任务,在目标捕获后获得协助奖励, 表示为步长奖励, 公式表达如下:;
式中,为追捕距离奖励, 为碰撞奖励;
追捕距离奖励 公式表达如下:
;
式中, 为剩余追捕距离, 为奖励 调节系数;
碰撞奖励 公式表达如下:
;
式中, ,表示追捕无人艇之间的最小行驶距离, , 为奖励 调节系数。
6.根据权利要求1所述一种高海况环境下的无人集群多目标搜索和追捕方法,其特征在于,步骤S5中建立多无人艇追捕机动决策模型,采用Actor‑Critic结构,通过双向递归神经网络连接每艘追捕无人艇的Actor网络和Critic网络,将单个追捕无人艇决策模型的Actor网络和 Critic网络中的隐藏层作为双向递归神经网络的递归单元,根据追捕无人艇的数量对其进行扩展;其中,追捕无人艇的个体目标函数公式表达如下:;
式中, 表示在状态转移函数 下采取动作 得到的状态分布, 为期望;
追捕无人艇编队的目标函数公式表达如下:;
策略网络参数 的梯度公式表达如下:
;
采用参数化临界函数 来估计上式的状态‑动作函数 ,并采用平方和损失函数来对Critic进行训练, 的梯度公式表达如下:式中,
为Q网络参数;
采用随机梯度下降法对Actor网络和Critic网络进行优化,在交互学习过程中,通过试错获得的数据更新网络参数,完成协同搜索追捕的优化。
7.根据权利要求6所述一种高海况环境下的无人集群多目标搜索和追捕方法,其特征在于,多无人艇协同目标追捕决策模型的训练学习过程包括以下步骤:S51、初始化Actor和Critic的在线网络参数,并将在线网络参数分配给对应的目标网络参数,即 和 ,其中 和 分别是Actor和Critic的目标参数,初始化经验回放空间 ,保存探索中获得的数据;
S52、确定训练的初始状态,设置追捕无人艇编队和目标的初始位置状态和速度状态;
S53、根据初始状态重复多集训练,模拟执行以下操作:每个追捕无人艇基于状态 和随机过程 生成一个动作 并执行;
执行完所有动作之后,状态转移至 ,计算奖励值 ,并且将传递过程变量存储到经验回放空间 ,在学习时,随机抽取一批 条经验数据去计算每艘追捕无人艇的目标Q值,公式表达如下:;
计算Critic的梯度估计,公式表达如下:;
根据得到的梯度估计 和 ,更新Actor和Critic的在线网络参数,随后,对目标网络参数进行更新,公式表达如下:;
式中, 。