利索能及
我要发布
收藏
专利号: 2024102178708
申请人: 南京信息工程大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-04
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种面向足球对战的数据驱动强化学习方法,其特征在于,包括如下步骤:步骤1、在网络平台上采集足球对战所需的数据集;

步骤2、对步骤1的数据进行预处理,得到预处理数据;

步骤2具体为:对于数据中的state,由于原始环境的state是字典的存储形式,将其变换为268维的向量以供训练,具体如下:首先是我方球员的绝对坐标,敌方球员的绝对坐标,形如N维的(x,y),总共10个球员,维度为(10×2),将他展平20维添加到最终的状态S中;

我方球员的移动目标,敌方球员的移动目标,形如N维的(x,y);

控球人员的绝对坐标——1维的(x, y),维度为1×2,展平2维加入到状态S;

球的绝对坐标——1维的(x, y, z);

球的移动方向——1维的(x, y, z);

表示持球方的one‑hot向量——2维(0,1)向量,(10,01)分别表示我方,敌方;

表示智能体控制球员的one‑hot向量——10维的(0,1)向量,表示智能体控制的球员;

表示当前游戏模式的one‑hot向量——7维的(0,1)向量表示使用的游戏模式;

以及球员可用的动作,球和当前所控制球员的相对距离,我方球员的疲劳指数,我方球员的黄牌、红牌、越位表示,敌方球员的越位表示,我方智能体控制球员与敌方球员的相对距离,我方球员的相对距离,距离比赛结束剩余的时间步,距离比赛过半剩余的时间步,进球数差异;剩余维度为0,将上述的数据组合为268维状态S;

其次,重新设计奖励函数,并根据函数修改了数据集中的reward;

足球环境本身的奖励信号是比较稀疏的,只有进球后存在奖励信号,重新设计奖励函数,并根据函数修改了数据集中的奖励reward,提出奖励方式有三种不同的权重:得分5倍权重、球的位置0.003的权重、黄牌1的权重,具体如下:得分:我方进球奖励值+5,对方进球奖励值‑5;

球的位置:如果球位于我方禁区‑0.006,我方半场‑0.003,敌方半场+0.003,地方禁区+

0.006;权重小是为了防止智能体不去进球,只带球到敌方半场;

黄牌:我方球员得黄牌‑1,敌方球员得黄牌+1;

将原始的30000场比赛每333场处理为一个checkpoint,将原始数据转换为bin文件存储;

步骤3、构建离线强化学习网络模型;

步骤3具体为:通过S,R,A,timesteps的各特征提取层包括ret_emb,act_emb,obs_emb, time_pos_encode分别算出预期回报R的特征嵌入向量R_embedding,动作A的特征嵌入向量a_embedding,状态S的特征嵌入向量s_embedding,时间步timestep的位置嵌入向量embedding,分别把R,A,S的embedding加上时间步的位置编码送入主体的Casual Transformer网络,具体公式如下:pos_embedding = embed_t(t)

s_embedding = embed_s(s) + pos_embeddinga_embedding = embed_a(a) + pos_embeddingR_embedding = embed_R(R) + pos_embedding送入主体的Casual Transformer网络之前将s_embedding,a_embedding,R_embedding,处理成一个序列,形如(R_1 , s_1 , a_1 , ..., R_K , s_K),公式如下:input_embeds = stack(R_embedding , s_embedding , a_embedding)送入主体的Casual Transformer网络后,根据网络的输出,通过一个线性层加激活层,输出动作的预测概率,再通过随机性或确定性采样得到最后的动作a;

步骤4、基于预处理数据,对离线强化学习网络模型进行训练及测试,得到训练完成的模型;

步骤5、基于训练完成的模型,解决谷歌足球环境中各智能体的决策问题。

2.根据权利要求1所述的一种面向足球对战的数据驱动强化学习方法,其特征在于,步骤1具体为:所采集的数据集包括kaggle比赛第六名公开代码训练好的足球AI 自博弈数据,以及通过与内置AI对战产生的数据;数据集包含20000场与内置AI对战产生的数据以及

10000场足球AI 自博弈数据;其中,与内置AI对战产生的数据包括4个不同难度:简单,中等,困难,kaggle比赛级。

3.根据权利要求1所述的一种面向足球对战的数据驱动强化学习方法,其特征在于,步骤4具体包括如下步骤:步骤4.1、设置模型训练的超参数,将hidden_embedding设为512,Casual Transformer使用2层decoder block,多头注意力使用4个head,训练采样的输入input序列长度为

25timestep,R和A的维度是1,state的维度是268,训练的批量大小batchsize是1024,采用Adam优化器,初始学习率0.0003,学习率的更新采样cos策略,每4000iters减少0.0000007,最低减少到0.00005;

步骤4.2、对模型进行训练,模型在数据集上训练100个epoch,迭代次数为1000000步,每20步输出一次loss,动作预测的准确度accuary,每10W步保存一次模型;

步骤4.3、模型测试,编写环境对应的测试代码,将训练好的模型在线的环境交互,记录

500场和内置AI不同难度的对战,取最终的胜率。