利索能及
我要发布
收藏
专利号: 2024117245866
申请人: 重庆邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-09
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于自监督对比学习和语义增强的草药推荐方法,其特征在于,包括以下步骤:步骤1:使用Word2vec单词嵌入算法,结合症状和草药的语义信息来训练症状和草药的特征表示;

步骤2:根据症状和草药之间的不同关系类型,构建多个图结构,包括:症状‑草药二部图、症状‑症状协同图、草药‑草药协同图;

步骤3:利用残差图卷积神经网络聚合邻域节点的表示来更新当前节点的表示;

步骤4:对协同图和二部图进行节点丢弃或者边缘丢弃,生成增强子图;

步骤5:在对增强子图进行编码后,利用自监督对比学习方法,计算子图节点之间的对比损失;

步骤6:将来自不同图的信息进行融合,计算草药能够治愈症状集的分数;

步骤7:结合交叉熵损失、Topk损失、对比损失,通过自适应优化算法调整梯度的大小和方向来优化模型;

所述步骤3:利用残差图卷积神经网络聚合邻域节点的表示来更新当前节点的表示,具体为:将步骤1得到的每个实体节点的Word2Vec嵌入通过一个线性层进行更新;

在步骤2得到的每个图上分别执行嵌入传播,得到每个图中每个节点的邻域表示;然后,构造一个残差结构来增强图中每个节点的特征,二部图 中存在两种类型的节点即症状和草药,使用两个独立的GCN来分别对症状节点和草药节点进行嵌入传播;在每个图中通过上式不断聚合更新节点表示;最终,在图 中得到的最后一层症状嵌入记为bs,草药嵌入记为bh,图 中得到的最后一层症状嵌入记为cs,图 中得到的最后一层草药嵌入记为ch;

所述步骤6:将来自不同图的信息进行融合,计算草药能够治愈症状集的分数,具体为:在获得多图嵌入之后,用CAT()或SUM()运算将症状和草药来自不同图的多角度信息进行组合,最终得到症状和草药的完整嵌入信息;

eS=COMBINE(bs,cs),eH=COMBINE(bh,ch)其中eS和eH分别代表最终的症状嵌入和草药嵌入,COMBINE(·)表示CAT()或SUM()操作;接着根据下式将处方中症状集的Multi‑hot编码与所有症状的嵌入交互,得到症状集的综合嵌入;

esyn=ReLU(W(mean(P·Es))+b)

其中,P是处方中症状集的一个Multi‑hot编码矩阵,Es是所有症状堆叠的嵌入矩阵,mean(·)是平均池化层;接下来计算所有草药能治愈症状集的分数,公式如下:其中Eh是所有草药堆叠的嵌入矩阵,σ(·)是Sigmoid激活函数。

2.根据权利要求1所述的基于自监督对比学习和语义增强的草药推荐方法,其特征在于,所述步骤1:使用Word2vec单词嵌入算法,结合症状和草药的语义信息来训练症状和草药的特征表示;具体为:给定症状和草药的文本描述,通过Word2Vec的Skip‑Gram模型学习每个词的嵌入表示,Skip‑Gram模型的目标是通过上下文单词预测中心单词,定义为:其中,wt是中心词,wt+j是上下文词,c是上下文窗口的大小,T是文本的总词数,θ是模型的参数,模型通过最大化上下文词给定中心词的条件概率P(wt+j|wt)来学习词向量,通过优化目标函数,得到每个词的嵌入向量,表示为一个d维的向量;对于每个症状和草药的文本描述,将其转化为词向量表示,并通过加权平均方法将每个症状和草药的特征表示为一个固定长度的向量es和eh,作为输入特征。

3.根据权利要求1所述的基于自监督对比学习和语义增强的草药推荐方法,其特征在于,所述步骤2:根据症状和草药之间的不同关系类型,构建多个图结构;包括:症状‑草药二部图、症状‑症状协同图、草药‑草药协同图;具体为:根据症状与草药之间的关系类型分别构造症状‑草药二部图 症状‑症状协同图 草药‑草药协同图 关系类型包括治疗关系、并发症、配伍原则,其中 表示症状节点集合, 表示草药节点集合, 涵盖所有症状与草药实体,边集则基于设定的过滤阈值进行定义:其中s为症状,h为草药,p为处方,Ts,Th为过滤阈值。

4.根据权利要求1所述的基于自监督对比学习和语义增强的草药推荐方法,其特征在于,所述步骤3:利用残差图卷积神经网络聚合邻域节点的表示来更新当前节点的表示,具体为:将步骤1得到的每个实体节点的Word2Vec嵌入通过一个线性层进行更新;

式中ei为节点i的Word2Vec嵌入, 为节点i执行图聚合之前的初始嵌入,Wi为线性变换矩阵,为了更新节点i在第(l+1)层的表示,在步骤2得到的每个图上分别执行嵌入传播,公式如下所示,得到每个图中每个节点的邻域表示;

式中 为节点i的邻域集合, 为节点i第l层的邻域表示,然后,构造一个残差结构来增强图中每个节点的特征,如下所示;

二部图 中存在两种类型的节点即症状和草药,使用两个独立的GCN来分别对症状节点和草药节点进行嵌入传播;这两个GCN虽然共享二部图 的拓扑结构,但使用不同的训练参数;

在每个图中通过上式不断聚合更新节点表示;最终,在图 中得到的最后一层症状嵌入记为bs,草药嵌入记为bh,图 中得到的最后一层症状嵌入记为cs,图 中得到的最后一层草药嵌入记为ch。

5.根据权利要求1所述的基于自监督对比学习和语义增强的草药推荐方法,其特征在于,所述步骤4:对协同图和二部图进行节点丢弃或者边缘丢弃,生成增强子图,具体为:通过执行节点丢弃或者边缘丢弃,将 和 分别生成两个增强子图;以 为例,两个增强子图定义为:或者

式中, 分别是控制保留节点集和边集的两个

随机掩蔽向量,其Dropout率为d。

6.根据权利要求1所述的基于自监督对比学习和语义增强的草药推荐方法,其特征在于,所述步骤5:在对增强子图进行编码后,利用自监督对比学习方法,计算子图节点之间的对比损失;具体为:将两个增强子图通过步骤3的方法进行编码后,得到增强子图的节点表示,对于症状端,症状i在两个增强图的最后一层嵌入分别记为 在节点尺度上对比子图,将同一节点视为正对,即 任意不同节点视为负对,即采用对比损失InfoNCE来最大化症状端正对的一致性,最小化症状端负对的一致性,计算如下:其中τ为Softmax中的温度超参数,φ(·)为两个向量的内积,草药端的损失计算方法相似,记为 分别对 执行相同操作,得到 从而形成自监督学习的最终目标函数为

7.根据权利要求1所述的基于自监督对比学习和语义增强的草药推荐方法,其特征在于,所述步骤7:结合交叉熵损失、Topk损失、对比损失,通过自适应优化算法调整梯度的大小和方向来优化模型,具体为:为了让模型更好地学习区分高概率的正例和负例,构造了如下损失函数来优化模型;

其中,N是批次中的样本数量,yi是第i个样本的目标值, 是模型对第i个样本的概率输出, 是第i个样本的前k个最高概率预测中的第j个概率,yij是对应的目标值;基本的二元交叉熵损失Lbce考虑了所有预测,而Topk损失专注于模型对最有可能的类别的预测准确性;结合步骤5的对比学习损失,因此最终的损失函数如下:L=Lbce+λ1LTopk+λ2Lssl

式中,λ1和λ2为控制对应损失函数强度的超参数;将Topk损失和对比学习损失视为辅助任务损失,分别记为Laux,1和Laux,2,将二元交叉熵损失视为目标任务损失,记为Ltar;则其中θ表示底层共享参数集,k表示一个epoch中的第k次训练迭代,Gx表示任务x相对于θ的梯度;为了引导优化过程朝向目标任务,如果辅助梯度与目标梯度相冲突,即它们的余弦相似度为负,首先通过将辅助梯度投影到目标梯度的法平面上来修改梯度方向,投影策略的公式如下:同时引入一个松弛因子r来缩减Gaux,i和Gtar之间的幅度差距;

通过改变辅助任务梯度方向和大小的混合操作,使得学习过程更容易向目标任务优化。

8.一种电子设备,包括存储器、处理器及存储在所述存储器上并可在所述处理器上运行的计算机程序,其特征在于,所述处理器执行所述程序时实现如权利要求1至7任一项所述基于自监督对比学习和语义增强的草药推荐方法。

9.一种非暂态计算机可读存储介质,其上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现如权利要求1至7任一项所述基于自监督对比学习和语义增强的草药推荐方法。