利索能及
我要发布
收藏
专利号: 2022108267091
申请人: 黑龙江大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-08-19
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.基于属性编辑流的分子生成方法,其特征在于:所述方法具体过程为:步骤一、建立分子对数据集;

步骤二、建立属性编辑流分子生成模型AEMF;

步骤三、训练属性编辑流分子生成模型AEMF;

步骤四、基于训练好的属性编辑流分子生成模型AEMF生成目标分子;

所述步骤二中建立属性编辑流分子生成模型AEMF;具体过程为:

属性编辑流分子生成模型AEMF包括流模块Flow和属性编辑器AttrEditor;

流模块Flow可实现分子数据到隐空间分布的可逆计算,给出一个分子m对应的图结构G(V,E),通过流模块Flow计算可得到分子m在隐空间对应的隐向量z,同时隐向量z经过流模块Flow的逆运算可得到分子m的图结构G(V,E);如下式:构建分子的边流Edge_flow和节点条件流Node_flow;

其中边流Edge_flow学习了一种可逆映射fE(E),实现了化学键信息到隐空间ZE的相互转换,如式(2)所示;

其中,fE表示学习边数据信息的边流Edge_flow;

节点条件流Node_flow学习了一种可逆映射fV|E(V|E),实现了原子信息到隐空间ZV|E的相互转换,如式(3)所示;

其中,fV|E表示学习节点数据信息的节点条件流Node_flow,V|E是一种条件概率,表示给出边信息条件下的节点信息,ZV|E|E是一种条件概率,表示给出边信息条件下的隐空间信息;

对于边流Edge_flow,fE(E)损失函数为

其中,PE表示边信息的概率函数, 表示隐空间信息的概率函数,det()表示行列式;

对于节点条件流Node_flow,fV|E(V|E)损失函数为

其中,PV|E表示给出边的条件下节点的条件概率, 表示给出边的条件下隐空间数据的条件概率,fV|E表示节点条件流Node_flow学习到的可逆映射;

所以针对整个流模块flow,将式6作为整个流模型Flow极大似然的优化目标;

其中,θE表示边流神经网络的可学习参数,θV|E表示节点条件流神经网络的可学习参数,PE(E;θE)表示边信息的概率函数,PG‑data表示真实数据分布的概率函数, 表示数学期望;

属性编辑器AttrEditor输入为分子1的属性a1和隐空间编码z1以及分子2的属性a2,通过构建的分子对数据集对属性编辑器AttrEditor进行训练,使属性编辑器AttrEditor输出z'2尽可能的靠近分子2的隐空间编码z2,即属性编辑器AttrEditor损失函数为均方误差LossMSE(z′2,z2);

属性编辑器AttrEditor内部包含全连接层Layer_lamda、N个隐藏层和输出层;

所述N取值为正整数;

在属性编辑器AttrEditor内部,首先计算两个属性向量的差Δa=a2‑a1,之后Δa经过全连接层Layer_lamda得到向量La,将隐空间向量z1和La拼接后的向量输入第一隐藏层,剩下的隐藏层输入都是前一个隐藏层的输出和La拼接后的向量,第N个隐藏层输出z'2,z'2经输出层输出。

2.根据权利要求1所述的基于属性编辑流的分子生成方法,其特征在于:所述步骤一中建立分子对数据集;具体过程为:选取分子数据集,由rdkit库计算得出分子数据集中每个分子的多个化学性质;

将每个分子的多个化学性质数值作为分量构成每个分子对应的属性向量;

计算分子数据集中每一个分子与所有其它分子的属性向量之间的欧氏距离,同时也计算出每一个分子与所有其它分子的相似性程度;

设置欧氏距离阈值和相似性阈值;

将分子数据集中所有既满足分子A和分子B的属性向量之间的欧氏距离大于欧氏距离阈值,又满足分子A和分子B的相似性程度大于相似性阈值的分子A和分子B保留,获得分子对数据集。

3.根据权利要求2所述的基于属性编辑流的分子生成方法,其特征在于:所述分子数据集为QM9分子数据集。

4.根据权利要求3所述的基于属性编辑流的分子生成方法,其特征在于:所述每个分子的多个化学性质为八种化学性质;

八种化学性质分别是分子量MolWt、脂水分配系数MolLogP、拓扑极表面积TPSA、重原子分子量HeavyAtomMolWt、氢键受体数NumHAcceptors、氢键供体数NumHDonors、环数RingCount、氨基羟基数NHOHCount;

所述分子量MolWt、脂水分配系数MolLogP、拓扑极表面积TPSA、重原子分子量HeavyAtomMolWt的取值为浮点型;

所述氢键受体数NumHAcceptors、氢键供体数NumHDonors、环数RingCount、氨基羟基数NHOHCount的取值为整型;

分子量MolWt、脂水分配系数MolLogP、拓扑极表面积TPSA、重原子分子量HeavyAtomMolWt、氢键受体数NumHAcceptors、氢键供体数NumHDonors、环数RingCount、氨基羟基数NHOHCount八个数值作为分量构成每个分子对应的属性向量。

5.根据权利要求4所述的基于属性编辑流的分子生成方法,其特征在于:所述步骤三中训练属性编辑流分子生成模型AEMF;具体过程为:属性编辑流分子生成模型AEMF首先训练流模块Flow,使流模块Flow具备将分子数据编码到隐空间中的能力,然后训练AttrEditor模块,通过流模块分子对数据集Flow可计算出一对分子中,m1分子对应的隐空间向量z1,通过rdkit库可计算出m1分子的属性向量a1,同样,也可计算出m2分子对应的隐空间向量z2和属性向量a2,z1、a1和a2作为模块AttrEditor的输入,将AttrEditor网络的输出与z2做均方误差,以此作为损失函数来优化AttrEditor模块,得到训练好的属性编辑流分子生成模型AEMF。

6.根据权利要求5所述的基于属性编辑流的分子生成方法,其特征在于:所述训练流模块Flow,使流模块Flow具备将分子数据编码到隐空间中的能力,具体过程为:根据分子数据集QM9训练流模块Flow,使流模块Flow具备将分子数据编码到隐空间中的能力。

7.根据权利要求6所述的基于属性编辑流的分子生成方法,其特征在于:所述训练AttrEditor模块,具体过程为:根据分子对数据集训练AttrEditor模块。

8.根据权利要求7所述的基于属性编辑流的分子生成方法,其特征在于:所述步骤四中基于训练好的属性编辑流分子生成模型AEMF生成目标分子;具体过程为:给出原分子m和目标属性向量at,通过rdkit库计算出分子m的属性向量a,通过训练好的属性编辑流分子生成模型AEMF中的流模块Flow计算出分子m对应的隐空间向量z,将z、a以及at作为输入送入到训练好的属性编辑流分子生成模型AEMF中的AttrEditor中,输出目标分子的隐空间向量zt,通过流模块Flow的逆运算对zt进行解码则得到具有目标属性at的分子mt;

以zt为高斯分布期望,设置标准差进行高斯采样,采样J次获取J个向量记作zt(1)、zt(2)、…、zt(J),zt(1)通过流模块Flow的逆运算解码可得到分子mt(1);zt(2)通过流模块Flow的逆运算解码可得到分子mt(2);以此类推得到分子mt(J),而这J个分子都是具有目标属性at或属性接近目标属性at的分子。