1.一种基于循环神经网络的蛋白质二级结构预测方法,其特征在于,所述预测方法包括以下步骤:
1)输入一个残基数为L的待进行蛋白质二级结构预测的蛋白质序列,记作S;
2)对蛋白质序列S,使用独热编码方式进行编码,得到一个大小为L×20的特征矩阵,记作M1,M1中第i行第j列元素表示为:其中,A1,A2,...,A20表示20种常见氨基酸类型的残基,Ti表示序列S中第i个残基的类型;
3)对蛋白质序列S,使用PSI‑BLAST程序生成蛋白质位置特异性评分矩阵,记作PSSM;
4)对M1和PSSM进行矩阵加法运算,获取一个大小为L×20的矩阵,记作M2;
5)计算矩阵M2中每一行的平均值,获取一个大小为L×1的向量,记作H;
6)计算矩阵M2中的每一行方差,获取一个大小为L×1的向量,记作V;
7)对蛋白质序列S,通过以下公式获取一个大小为L×20的特征矩阵F,F中第i行第j列元素表示为:其中, 表示M2中第i行第j列元素,Hi表示H中第i个元素,Vi表示V中第i个元素;
8)矩阵F中任意一行Fi,i=1,2,...,L,表示蛋白质序列S中第i个残基的特征向量;
9)从PDB数据库中获取已知残基二级结构类别的蛋白质序列作为训练集,所述残基二级结构类别包括埋藏、中间状态和暴露,使用步骤2)‑8)生成训练集中所有残基的特征向量;结合残基二级结构类别标签,构建训练样本集;
10)搭建循环神经网络预测蛋白质序列S中残基的二级结构类别,该网络由三个部分组成,第一个部分是卷积层部分,该部分由一个卷积核大小为1×20的卷积层、一个卷积核大小为3×1的卷积层、一个归一化层、一个池化层组成;第二个部分是循环层部分,该部分由两个LSTM层组成;最后一个部分是全连接层部分,该部分由两个全连接层组成,每一层输出作为下一层的输入,使用sigmoid激活函数使网络的输出值在(0,1)范围内;
11)使用步骤9)中构建的训练样本集训练步骤10)中搭建的网络,训练阶段采用交叉熵损失函数调整网络中的参数,交叉熵损失函数记作:其中,u表示蛋白质序列中待测残基的真实标签,表示网络模型预测残基类别对应的输出值,Y表征预测输出与真实标签的差距;
12)将蛋白质序列S中残基的特征向量输入到步骤11)训练的模型中,根据模型输出每个残基二级结构类别的概率值,概率最大值对应的类别即为该残基二级结构的预测类别。