利索能及
我要发布
收藏
专利号: 2024113683217
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种融合时间感知与路径推理的可解释序列推荐方法,其特征在于,所述方法包括以下步骤:(1)构建时序协作知识图谱

根据用户的历史交互信息对协作知识图谱进行切片,得到一系列有序的快照,建立时序协作知识图谱,时序协作知识图谱TCKG表示为 ,其中表示CKG 在时刻 的快照,其中 表示头实体,表示实体集合,表示关系集合;

(2)时序协作知识图谱表示学习

采用TransE翻译模型对TCKG进行实体和关系嵌入,对于给定的 中的三元组 ,其中 均具有 维嵌入,即 ,将评分函数定义为 到 之间的距离,公式如下:

(1);

正例三元组和负例三元组之间相对顺序的损失函数定义为:(2);

其中 ,且 是将尾实体替换为随机实体 后的负例三元组, 为sigmoid函数;

通过训练得到用户向量集合 、物品向量集合{ 和关系向量集合{ ;

(3)设计时间感知系统

首先,多条路径向量传递给时间感知系统,这些路径反映了用户不同的购买偏好,采用路径注意力机制将多条路径向量进行聚合,得到的多路径聚合向量能更好地表征实体之间复杂的联系,路径注意力机制计算公式为:(3);

                              (4);

其中 是 , 是softmax函数,、、 是路径 关联的自注意力变量,是权重矩阵,是维度, 是连接操作;

在得到多路径聚合向量后,采用物品注意力机制,将当前物品的自身信息与路径聚合向量结合,以融入历史时序信息,更新当前时刻的物品向量,物品注意力机制计算公式为:             (5);

其中 表示当前物品的初始表示, 是从第 个物品到第个物品的路径实例,是权重矩阵,是偏差, 是 ;

将用户向量和物品向量进行拼接,将拼接后的向量输入到多层感知机,生成该时刻的物品预测向量,计算公式为:(6);

(4)设计路径推理系统

路径推理系统在时间感知系统生成的物品预测向量的指导下进行关联路径推理,再通过路径表示学习得到上述多条路径向量,该系统采用强化学习框架来建立推理环境,该环境向策略决策模块提供当前环境状态和TCKG中可执行操作的信息,并根据当前策略与用户交互的匹配程度对决策模块进行奖励;

(5)模型训练

两个系统迭代工作、相互补充,将时间感知系统输出的物品预测向量传递给路径推理系统进行关联路径推理,然后将路径推理系统输出的多条路径向量与当前时间步的物品向量和用户向量输入到时间感知系统,得到物品预测向量;

得到训练好的模型,为用户提供准确的推荐结果。

2.如权利要求1所述的一种融合时间感知与路径推理的可解释序列推荐方法,其特征在于,所述(3)中,由于第一个物品之前没有历史时序信息,将用户向量和第一个物品向量进行拼接,将拼接后的向量输入到多层感知机,生成该时刻的物品预测向量,计算公式为:(7);

将生成的物品预测向量输入路径推理系统进行关联路径推理。

3.如权利要求1或2所述的一种融合时间感知与路径推理的可解释序列推荐方法,其特征在于,所述(4)的过程如下:(4.1)状态(State):初始状态为 ,在时间步的状态 ],其中表示用户实体,表示包含 步的历史记录( , ),表示当前步骤的实体, 表示时间感知系统对时间步 生成的实体估计向量;

(4.2)动作(Action):在时间步 ,动作表示为 ,其中 表示下一个要访问的实体, 表示当前实体和 之间的关系;

(4.3)剪枝策略:为了提高模型效率,同时控制空间复杂度,需在保持动作空间的最大出度基准的同时进行有效的推理,使用得分函数对每个动作计算得分,定义如下:(8);

其中 表示点积运算, 是 跳时的关系嵌入,对动作空间中的所有动作按照得分进行排序,并保留排名前 的动作在修剪后的动作空间 中,定义为:(9);

其中 是预定义的动作空间大小,用于限制剪枝后的动作数量;

(4.4)状态转移:给定状态 和动作 以及时间感知系统传递的物品表示,状态转移表示为:[ ](10);

(4.5)奖励函数:强化学习的目标是找到用户‑物品路径实例和物品‑物品路径实例,为了评估不同路径的质量和选择的灵活性,使用软奖励来达成上述目标,奖励函数定义为: (11);

其中 表示物品实体,表示物品实体集合,表示路径搜索的最大步数;如果在 步之前找到目标实体,则进行奖励计算,否则奖励为0;

(4.6)优化策略:利用状态信息和动作空间对路径推理策略进行参数化,时间步的状态],包含搜索历史 ,采用双向LSTM来编码状态向量 ,公式如下:(12);

其中 是线性参数,策略网络 输出在剪枝空间 中每个动作的概率:(13);

其中 是需要学习的线性参数,在策略梯度方法中,希望通过最大化累积奖励来优化策略,为了提高训练效率,引入基线来减小方差,价值网络 将状态向量 映射为强化学习中的实值作为基线:(14);

其中 是需要学习的线性参数,这两个网络是通过最大化任意用户u的预期奖励来训练的,通过REINFORCE算法进行优化,该算法使用以下策略梯度更新模型参数Θ:(15);

其中 表示从状态 开始到终止状态的折扣累积奖励;

(4.7)路径表示学习:获得候选用户‑物品和物品‑物品路径实例,将路径数据表示为,其中 表示路径在时间步 的特征向量,是路径的长度,将路径数据输入到LSTM层,LSTM将输入序列映射到一个固定大小的嵌入向量,其计算公示如下:(16);

其中 是权重矩阵, 是前一时间步的隐藏状态,LSTM层输出的最后一个隐藏状态 表示为路径向量,将路径向量作为指导信息传输给时间感知系统。

4.如权利要求1或2所述的一种融合时间感知与路径推理的可解释序列推荐方法,其特征在于,所述(5)中,将经过多次迭代后最终得到的物品预测向量和用户向量输入多层感知器计算用户‑物品的预测分数:(17);

其中MLP包含两个隐藏层,使用ReLU作为激活函数,Sigmoid函数作为输出层;

使用负采样的隐式反馈损失作为整个损失函数:](18);

其中 表示对负样本集上的期望值进行计算,其中 表示负样本的分布,表示从该分布中抽取的样本。