利索能及
我要发布
收藏
专利号: 2025113314452
申请人: 湖南师范大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-09
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于强化学习驱动大模型自适应提示的推荐方法,其特征在于,包括下述步骤:S101,获取用于表示用户偏好的用户画像文本,将用户画像文本与预设的多种提示词类型描述进行语义相似度匹配以确定用户对应的提示词类型;

S102,将编码后的用户画像文本作为状态、提示优化策略作为动作,通过深度Q网络DQN结合状态、动作以及上一轮的即时奖励信号 在多种提示优化策略中选择推荐的提示优化策略;根据上一轮的即时奖励信号 更新历史奖励信号 ,通过置信上限算法UCB根据历史奖励信号 在预设的多种提示优化策略选择推荐的提示优化策略;将两种推荐的提示优化策略加入策略候选池并执行策略决策以获得最终的提示优化策略S;

S103,基于最终的提示优化策略S和用户对应的提示词类型利用大模型生成优化后的提示词,并利用推荐系统进行验证,执行推荐系统的性能指标评估,并更新计算本轮的即时奖励信号 ;

S104,判断是否满足预设的结束条件,如果满足预设的结束条件,则将最后得到的优化后的提示词输出以用于目标推荐系统来获得推荐结果;否则,跳转步骤S102继续迭代。

2.根据权利要求1所述的基于强化学习驱动大模型自适应提示的推荐方法,其特征在于,步骤S102中通过深度Q网络DQN结合状态、动作以及上一轮的即时奖励信号 在多种提示优化策略中选择推荐的提示优化策略包括:首先通过深度Q网络DQN结合状态、动作以及上一轮的即时奖励信号 分别计算多种提示优化策略中每一种提示优化策略的预期累积奖励;然后利用 ‑贪心策略以预设的基础探索率 的概率在多种提示优化策略中随机选择推荐的提示优化策略,以 的概率选择使得更新后的预期累积奖励最大的动作所对应的提示优化策略作为推荐的提示优化策略。

3.根据权利要求1所述的基于强化学习驱动大模型自适应提示的推荐方法,其特征在于,步骤S102中根据上一轮的即时奖励信号 更新历史奖励信号 的函数表达式为:;

其中,为学习率, 为第 轮次的历史奖励信号。

4.根据权利要求1所述的基于强化学习驱动大模型自适应提示的推荐方法,其特征在于,步骤S102中通过置信上限算法UCB根据历史奖励信号 在预设的多种提示优化策略选择推荐的提示优化策略包括:首先通过置信上限算法UCB根据历史奖励信号 分别计算多种提示优化策略中每一种提示优化策略的UCB得分:;

其中, 为动作 对应提示优化策略的UCB得分, 为动作 对应提示优化策略的尝试次数, 为取最大值, 为动态衰减探索系数,为迭代轮次,为总尝试次数;然后选择UCB得分最高的提示优化策略作为推荐的提示优化策略。

5.根据权利要求1所述的基于强化学习驱动大模型自适应提示的推荐方法,其特征在于,步骤S102中将推荐的提示优化策略加入策略候选池并执行策略决策以获得最终的提示优化策略S包括:为策略候选池中的提示优化策略分配初始的权重向量 :;

其中, 为深度Q网络DQN推荐的提示优化策略的权重, 为置信上限算法UCB推荐的提示优化策略的权重;使用softmax函数对权重向量 进行归一化处理:;

其中, 为权重 的归一化权重,权重 和 分别为第 个权重和第 个权重, ;

根据归一化后的概率分布进行随机抽样确定最终的提示优化策略 :

其中, 表示对应关系, 为分类分布, 和 分别为 和 的归一化权

重。

6.根据权利要求1所述的基于强化学习驱动大模型自适应提示的推荐方法,其特征在于,步骤S103中基于最终的提示优化策略S和用户对应的提示词类型利用大模型生成优化后的提示词包括:将基于最终的提示优化策略S、用户对应的提示词类型所对应的初始的软提示优化指令、上一轮的即时奖励信号 、历史摘要以及提示推荐案例结合以形成用于指导大模型优化推荐提示的最终提示优化模板,将最终提示优化模板输入大模型生成优化后的提示词,所述历史摘要包括最近多轮的最终的提示优化策略、即时奖励信号及性能指标。

7.根据权利要求1所述的基于强化学习驱动大模型自适应提示的推荐方法,其特征在于,步骤S103中更新计算本轮的即时奖励信号 的函数表达式为:;

其中,为性能指标的数量, 为第个性能指标的权重, 为第个性能指标在本轮的值, 为第个性能指标在上一轮的值,为防除零常数。

8.一种基于强化学习驱动大模型自适应提示的推荐系统,包括相互连接的微处理器和存储器,其特征在于,所述微处理器被编程或配置以执行权利要求1~7中任意一项所述基于强化学习驱动大模型自适应提示的推荐方法。

9.一种计算机可读存储介质,该计算机可读存储介质中存储有计算机程序或指令,其特征在于,该计算机程序或指令被编程或配置以通过处理器执行权利要求1~7中任意一项所述基于强化学习驱动大模型自适应提示的推荐方法。

10.一种计算机程序产品,包括计算机程序或指令,其特征在于,该计算机程序或指令被编程或配置以通过处理器执行权利要求1~7中任意一项所述基于强化学习驱动大模型自适应提示的推荐方法。