利索能及
我要发布
收藏
专利号: 2024107124051
申请人: 南京信息工程大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-04
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于谷歌足球模拟器的强化学习方法,其特征在于,包括如下步骤:基于谷歌足球模拟器构建谷歌足球环境,获取所述谷歌足球环境当前时刻的观测信息;

根据所述当前时刻的观测信息,利用训练好的大语言模型生成动作提示信息;

根据所述动作提示信息,利用智能体从策略网络中选择动作并反馈到所述谷歌足球环境;

根据动作执行后谷歌足球环境下的足球比赛视频和所述动作提示信息,利用训练好的视频文本检索模型计算所述足球比赛视频和所述动作提示信息的相似度,进而得到相似度奖励;

根据所述当前时刻的观测信息计算足球基础奖励;

根据所述足球基础奖励和所述相似度奖励得到强化学习总奖励;

根据所述强化学习总奖励,利用近端策略优化算法更新智能体的策略网络的参数;

所述根据动作执行后谷歌足球环境下的足球比赛视频和所述动作提示信息,利用训练好的视频文本检索模型计算所述足球比赛视频和所述动作提示信息的相似度,进而得到相似度奖励,包括:将动作执行后谷歌足球环境下的足球比赛视频和动作提示信息输入到训练好的视频文本检索模型中;

将足球比赛视频切分为多个视频帧并线性投影到视频文本检索模型的图像编码器上,利用图像编码器对每个视频帧进行编码,得到多个图像特征;

利用视频文本检索模型的时间聚合器将多个图像特征合并为单个图像特征进行嵌入,得到视频特征;

利用视频文本检索模型的文本编码器对动作提示信息进行编码,得到文本特征;

根据视频特征和文本特征计算相似度得分,计算公式为:;

其中, 表示第i个视频特征与第j个文本特征之间的相似度,T表示转置运算;

表示第i个视频信息的视频特征,表示第j个文本信息的文本特征; 表示2‑范数;

根据视频特征与文本特征的相似度计算相似度奖励,计算公式为:;

其中, 表示相似度奖励, 表示视频文本相似度, = ,p表示动作提示信息,V表示动作执行后谷歌足球环境下的足球比赛视频,R表示动作提示信息与足球比赛视频之间的相似度的计算, 表示足球比赛视频V与动作提示信息p的语义相似性概率;

所述强化学习总奖励的计算公式如下:

其中, 表示相似度奖励, 表示强化学习总奖励, 表示足球基础奖励,为奖励权重;

所述根据所述强化学习总奖励,利用近端策略优化算法更新智能体的策略网络的参数,其中,近端策略优化算法的目标函数为:;

其中, 为最大化函数,表示策略,s表示谷歌足球环境的状态,a表示动作,表示旧策略函数, 表示旧策略, 表示在状态s下从旧策略 中选择动作a的期望, 表示在旧策略 下采样得到的状态‑动作对(s,a)的损失;

基于强化学习总奖励,计算谷歌足球环境的状态和动作的值:;

其中,Q(s,a)表示在状态s下采取动作a的动作值, 表示强化学习总奖励,γ为折扣因子, 为t+1时刻状态 的价值, 为t时刻的状态, 为t时刻的动作,V(s)表示在状态s的价值,E[ ]表示期望函数;

根据谷歌足球环境的状态和动作的值,计算优势估计:;

其中, 表示在状态s下采取动作a的优势估计值;

根据优势估计计算策略网络的损失函数,表达式为:;

其中, 表示当前策略 下采取动作a之后的概率, 表示旧策略下采取动作a的概率,为正数,clip( )为取值范围限制函数, 表示取最小值。

2.根据权利要求1所述的基于谷歌足球模拟器的强化学习方法,其特征在于,所述观测信息包括谷歌足球环境中每个球员的位置信息、足球位置、足球移动轨迹、比赛得分和像素RGB信息。

3.根据权利要求1所述的基于谷歌足球模拟器的强化学习方法,其特征在于,所述根据所述当前时刻的观测信息,利用训练好的大语言模型生成动作提示信息,包括:将当前时刻的观测信息转换成高维度向量,得到输入编码特征,并输入训练好的大语言模型;

利用根均方范数归一化方法对输入编码特征进行归一化处理,得到归一化后的特征序列;

利用注意力机制处理归一化后的特征序列,得到观测信息中不同词的概率分布;

利用线性层对不同词的概率分布进行加权和转换,得到当前时刻的观测信息对应的动作提示信息。

4.根据权利要求3所述的基于谷歌足球模拟器的强化学习方法,其特征在于,利用注意力机制处理归一化后的特征序列,得到观测信息中不同词的概率分布,包括:利用变体的注意力机制将查询向量进行分组,并在组内共享键值对,利用查询向量查询归一化后的特征序列中的词元;

利用旋转位置编码对查询到的词元进行位置编码,并在位置编码过程中,利用因果掩码来保证只利用当前位置之前的词元信息进行预测;

利用softmax函数对位置编码后的词元进行分类,获得观测信息中不同词的概率;

利用前馈神经网络对观测信息中不同词的概率进行非线性变换,输出不同词的概率分布。

5.根据权利要求1所述的基于谷歌足球模拟器的强化学习方法,其特征在于,所述大语言模型和所述视频文本检索模型的训练方法为:根据大量真实足球比赛的视频数据和文本数据,生成大语言模型和视频文本检索模型的训练样本集,其中,所述大语言模型的训练样本集包括真实足球比赛中多个时间段的文本信息以及对应的动作提示信息,所述视频文本检索模型的训练样本集包括真实足球比赛中多个时间段的视频信息和文本信息;

根据大语言模型的训练样本集,利用预训练模型权重和LoRA微调方法对大语言模型进行微调,得到训练好的大语言模型;

根据视频文本检索模型的训练样本集,利用交叉熵损失对视频文本检索模型进行优化,得到训练好的视频文本检索模型。

6.根据权利要求5所述的基于谷歌足球模拟器的强化学习方法,其特征在于,所述根据大语言模型的训练样本集,利用预训练模型权重和LoRA微调方法对大语言模型进行微调,得到训练好的大语言模型,包括:通过选择预训练权重和分词器,初始化大语言模型的模型参数,并通过RLHF对大语言模型进行预训练,得到预训练的大语言模型;

在预训练的大语言模型的每一层中添加可训练的旁路矩阵,将预训练的大语言模型中的参数冻结为预训练参数,将可训练的旁路矩阵作为微调参数;

通过调用LoRA的微调脚本程序,在大语言模型的训练样本集上对微调参数进行更新,得到微调后的大语言模型;

通过调用LoRA的合并脚本,将微调后的大语言模型与预训练的大语言模型进行融合,得到训练好的大语言模型。

7.根据权利要求5所述的基于谷歌足球模拟器的强化学习方法,其特征在于,所述根据视频文本检索模型的训练样本集,利用交叉熵损失对视频文本检索模型进行优化,得到训练好的视频文本检索模型,包括:将视频文本检索模型的训练样本集中的视频信息和文本信息分别输入视频文本检索模型的视频编码器和文本编码器;

在视频编码器中,利用图像编码器对视频信息的视频帧进行编码,并利用时间融合器将编码后的视频帧融合,得到视频特征;

通过文本编码器对文本信息进行编码,得到文本特征;

根据视频特征和文本特征,计算任意一对视频特征与文本特征之间的相似度;

根据所有视频特征与文本特征之间的相似度,计算视频文本检索模型的对称交叉熵损失,公式如下:;

其中, 表示通过视频检索文本时的交叉熵损失, 表示通过文本检索视频时的交叉熵损失, 表示第i个视频信息的视频特征, 表示第i个文本信息的文本特征,表示第i个视频特征与第i个文本特征之间的相似度,N表示视频文本检索模型的训练样本集中的样本数量,i、j∈[1, N], 表示视频文本检索模型的对称交叉熵损失;

根据视频文本检索模型的对称交叉熵损失,对视频文本检索模型中文本编码器和图像编码器的最后两层进行微调,得到微调后的视频文本检索模型;

重复上述步骤,在训练样本集上训练视频文本检索模型2个周期,得到训练好的视频文本检索模型。