1.一种基于蛋白质序列比对的分子虚拟筛选方法,其特征在于,所述方法包括以下步骤:
1)输入一个残基数目为L的待进行分子筛选的蛋白质序列P;
2)对蛋白质序列P,使用HHblits程序搜索蛋白质序列数据库UniRef90,生成一个包含M条序列的多序列联配信息,记作MSA;
3)对MSA文件,计算出大小为L×20的位置特异性频率矩阵,记作PSFM:其中,PSFMi,j表示PSFM中第i行第j列元素,i=1,2,...,L,j=1,2,...,20,Resj表示20种残基中第j种的残基类型,所述20种残基为:A、R、N、D、C、Q、E、G、H、I、L、K、M、F、P、S、T、W、Y、V, 表示MSA中第m条序列的第i个位置的残基类型, 表示当 与Resj相同时,则输出为1,否则输出为0;
4)对蛋白质‑配体相互作用数据库BioLiP中的每一条蛋白质序列按照步骤2)至步骤3)生成对应蛋白质的PSFM矩阵;
5)根据蛋白质序列P的PSFM矩阵与BioLiP库中每条蛋白质序列T的PSFM矩阵信息,计算出P与T的相似矩阵,记作S:
其中,Si,j表示P中的第i个残基与T中的第j个残基的对齐得分,i=1,2,...,L,j=1,
2,...,LT,LT表示蛋白质序列T的残基数目; 表示P的PSFM矩阵中第i行第k列的元素,表示T的PSFM矩阵中第j行第k列元素;当T的第j个残基为配体分子结合位点时,否则 表示P的第i个位置残基类型, 表示T的第j个位置残基类型,为根据 和 残基类型从BLOSUM62替换打分矩阵中查询的值;w1和w2为两个常数,分别对应的PSFM矩阵和配体位点所占的权重;计算由P与T中残基组成的所有残基对对齐得分;
6)根据步骤5)获得的P与T的相似矩阵,使用Needleman‑Wunsch动态规划算法计算出P中残基与T中残基的对齐信息,记作 i=1,2,...,Lali,其中,Lali为P中残基与T中残基对齐的残基对数目, 表示第i对残基对中P中的残基在P中的位置, 表示第i对残基对中T中的残基在T中的位置;
LBS
7)计算蛋白质序列P与T的相似度匹配质量,记作Q :其中, 表示P中的第 个残基与T中的第 个残基对齐的得分;
8)根据步骤5)至步骤7),计算BioLiP中每条蛋白质序列T与输入蛋白质序列P的相似度LBS LBS
匹配质量Q ,从BioLiP中选择所有Q ≥0.5的蛋白质序列,并将BioLip中与这些蛋白质序列相互作用的配体小分子挑选出来组成分子集,记作 其中NTPD为TPD中的分子数目, 为TPD中第i个分子,i=1,2,...,NTPD;这里TPD中的每个分子 可以理解为能与P发生相互作用的潜在分子;
9)对TPD中的每个分子 i=1,2,...,NTPD,使用OpenBabel软件生成一个包含1024个比特位的分子指纹 其中,每一个比特位的值为0或1;
10)对待筛选的分子库DrugBank中的每个分子 j=1,2,...,NDrugBank,亦使用OpenBabel软件生成一个包含1024个比特位的分子指纹 其中NDrugBank为分子库DrugBank中分子总数;
11)计算TPD中的每个分子 i=1,2,...,NTPD,的分子指纹 和DrugBank中的每个分子 j=1,2,...,NDrugBank,的分子指纹 之间的相似值TaniCoeffi,j:其中, 为 中第k个位置元素的值, 为 中第k个位置元素的值,k=1,2,...,1024;
12)根据步骤11)计算得到所有值,计算DrugBank中每个分子 可能与输入蛋白质序列P发生相互作用的概率值VSscoj:其中,TaniCoeffi,j表示TPD中的第i分子 的分子指纹 和DrugBank中的第j个分子 的分子指纹 之间的相似值;
13)根据VSscoj值,对DrugBank中的所有分子从高到低进行排序,取排序靠前的x·NDrugBank个分子作为最终的虚拟筛选结果返回;其中,x为需要从待筛选分子数据库DrugBank中的筛选比率,取值范围为0到1。