1.一种采用渐近式搜索MSA的蛋白质系综预测方法,其特征在于,所述方法包括以下步骤:
1)给定目标蛋白质的序列信息;
2)根据给定的目标蛋白的序列信息,使用MMSeqs生成多序列比对MSA;
3)对于生成的MSA,进行聚类,聚类时去除序列中GAP占比大于设定阈值的序列;
4)对于完成聚类后的子MSA,采用BLAST序列比对方法找出序列中心;
5)使用子MSA中序列中心再次使用MMSeqs生成对应的MSA;
6)对于生成的这组新的MSA,重复上述处理步骤2)至步骤5)的处理流程;
7)将循环得到的多个子MSA合并为一个新的MSA,确保每个初始序列仅对应一个整合后的MSA;
8)移除数据库搜索中重复的序列;
9)对于MSA中序列长度和初始序列不同的序列,使用MAFFT多序列比对工具插入适当的GAP;
10)使用步骤3)的方式聚类,保留GAP占比大于设定阈值的序列;
11)将处理好的多个MSA逐次输入到AlphaFold2中生成蛋白质构象系综。
2.如权利要求1所述的一种采用渐近式搜索MSA的蛋白质系综预测方法,其特征在于,所述3)的过程如下:
3.1)使用DBSCAN进行MSA聚类得到多个子MSA,DBSCAN的聚类判定的两个核心条件是ε和minPts,表示邻域的最大距离和在ε邻域内的最小点数;
3.2)对于DBSCAN聚类方法无法成功聚类的MSA,使用高斯混合模型GMM的期望最大化EM聚类。
3.如权利要求2所述的一种采用渐近式搜索MSA的蛋白质系综预测方法,其特征在于,所述3.2)的过程为:
3.2.1)计算每个数据点xi属于第k个簇的概率:其中,γik表示数据点xi属于第k个簇的后验概率,用来衡量每个簇k对数据点xi的高斯分布所解释的可能性,πk表示每个高斯分布的先验概率,即数据点属于该簇的比例,N是高斯分布的概率密度函数,μk是第k个高斯分布的均值向量,∑k是第k个高斯分布的协方差矩阵,N(xi|μk,∑k)是xi在第k个高斯分布上的概率密度函数值, 表示所有xi被所有K个高斯分布所解释的总概率密度;
3.2.2)更新参数:利用3.2.1)步中计算出的概率,更新每个簇的均值,协方差以及权重:均值:
其中,μk是第k个高斯分布的均值向量, 对所有数据点xi的加权求和,权重是其属于第k簇的后验概率;
协方差:
其中,∑k是第k个高斯分布的协方差矩阵; 是对所有数据点的加权协方差求和,权重是其属于第k簇的后验概率;
权重:
其中,πk是第k个高斯成分的权重,N是总样本数,用于归一化;
3.2.3)反复执行3.2.1)步和3.2.2)步,直到模型的参数,即均值、协方差、权重收敛,即参数的变化非常小,或者达到预设的迭代次数。
4.如权利要求1~3之一所述的一种采用渐近式搜索MSA的蛋白质系综预测方法,其特征在于,所述4)的过程如下:
4.1)对每对序列运行BLASTP进行比对,计算他们的Bitscore;
4.2)将每个查询序列的比对得分汇总,计算其与其他序列的平均比对得分;
4.3)得分最高的视为序列中心。
5.如权利要求4所述的一种采用渐近式搜索MSA的蛋白质系综预测方法,其特征在于,所述4.1)的过程为:
4.1.1)BLASTP是一种用于蛋白质序列比对的工具,是BLAST工具家族的一部分,它通过对比输入的蛋白质序列与数据库中的蛋白质序列,来寻找局部相似性,并计算它们的比对得分;
4.1.2)Bitscore是BLAST比对结果中的一个重要评分指标,用于衡量两条序列之间的相似性;
′
其中,S 是标准化比对得分,用于衡量两条序列之间比对的显著性,S是原始比对得分,反映两条序列的比对质量,λ是统计比例系数,使得比对得分具有统一的尺度,K是统计校正因子,将比对的显著性标准化,使得在不同背景下比对结果具有可比性。
6.如权利要求1~3之一所述的一种采用渐近式搜索MSA的蛋白质系综预测方法,其特征在于,所述9)的过程如下:
9.1)首先读取所有输入的A3M文件并提取序列;
9.2)然后,使用MAFFT对这些已调整长度的序列进行比对,MAFFT会根据序列的差异,自动在对齐过程中添加必要的GAP,如果在某些位置,序列之间存在缺失,MAFFT会在这些位置插入GAP,以便所有序列能够在这些位置上对齐;
9.3)MAFFT输出的对齐结果会包含插入的GAP,这些GAP代表了序列在该位置上没有相应的氨基酸或核苷酸,对齐后的序列会被写入输出文件中,确保所有序列的长度一致并对齐。
7.如权利要求1~3之一所述的一种采用渐近式搜索MSA的蛋白质系综预测方法,其特征在于,所述3)和10)中,设定阈值为25%。