利索能及
我要发布
收藏
专利号: 2021100868315
申请人: 浙江工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-07-29
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于循环网络的蛋白质与蛋白质相互作用预测方法,其特征在于,所述预测方法包括以下步骤:

1)输入两条蛋白质残基个数分别为LA和LB的待进行蛋白质与蛋白质相互作用预测的蛋白质序列信息,分别记作SA和SB;

X X

2)对任意给定的一条残基个数为L的蛋白质序列信息,记作S ,使用如下步骤计算S 的残基组成特征、残基过渡特征、残基分布特征,过程如下:

2.1)将已知的20种氨基酸类型分别记作:A、G、U、D、E、M、S、T、Y、F、I、L、P、H、N、Q、W、K、R、XC,根据蛋白质残基侧链的偶极子和体积,将S 中的20种氨基酸分为七组:“A、G、U”,“D、E”,“M、S、T、Y”,“F、I、L、P”,“H、N、Q、W”,“K、R”,“C”,分别记作B1、B2、B3、B4、B5、B6、B7,同一组的氨基酸由于特征相似,会发生同义突变;

X

2.2)计算S中每一组残基组成特征,记作Cr:Cr=Nr/L,其中r=1,2,3,4,5,6,7,Nr为某X

一组在S中残基总数;

X

2.3)计算S中每一组残基过渡特征,共有21种残基过渡类型,分别为B1过渡为B2或者B2过渡为B1、B1过渡为B3或者B3过渡为B1、……、B6过渡为B7或者B7过渡为B6,记作Tr:Tr=Mr/X

L,其中r=1,2,3,……20,21,Mr为21种残基过渡类型中某一类型在S中的总数;

X

2.4)计算S 中每一组残基分布特征,记作 其中 表示七组中的X

某一组在S中第Nr×p个残基的索引值,r=1,2,3,4,5,6,7,X

2.5)将S在25%×L、50%×L、75%×L三个位点处切成4个片段,分别记作L1、L2、L3、L4,从L1、L2、L3、L4中随机抽取两个或者三个不重复的片段进行片段组装,形成一个片段,共生成10个新的片段:L1L2、L1L3、L1L4、L2L3、L2L4、L3L4、L1L2L3、L1L2L4、L2L3L4、L1L3L4;

2.6)将步骤2.5)获得的14个片段,根据步骤2.1)至2.4)生成对应的残基组成特征、残X

基过渡特征、残基分布特征,每一个片段生成63维特征,由S和14个片段一共得到945维特征向量;

X

3)根据蛋白质与蛋白质界面热点倾向性,将S中的20种氨基酸分为3组:“D、H、I、K、N、P、X

R、W、Y”,“E、Q、S、T、G、A、M、F”,“C、L、V”,分别记作J1、J2、J3,使用如下步骤计算S的残基组成特征、残基过渡特征、残基分布特征,过程如下:X X

3.1)计算S 中每一组残基组成特征,记作Ci:Ci=Ni/L,其中i=1,2,3,Ni为某一组在S中残基总数;

X

3.2)计算S中每一组残基过渡特征,共有3种残基过渡类型,分别为J1过渡为J2或者J2过渡为J1、J1过渡为J3或者J3过渡为J1、J2过渡为J3或者J3过渡为J2,记作Ti:Ti=Mi/L,其X

中i=1,2,3,Mi为3种残基过渡类型中某一类在S中的总数;

X

3.3)计算S中每一组残基分布特征,记作 其中 表示七组中的X

某一组在S中第Ni×p个残基的索引值,r=1,2,3,X

4)根据蛋白质二级结构,将S中的20种氨基酸分为3类:“E、A、L、M、Q、K、R、H”,“V、I、Y、C、XW、F、T”,“G、N、P、S、D”,分别记作Z1、Z2、Z3,使用步骤3.1)至3.3)计算S的残基组成特征、残基过渡特征、残基分布特征;

X

5)根据蛋白质溶剂可及性,将S中的20种氨基酸分为3类:“A、L、F、C、G、I、V、W”,“P、K、Q、XE、N、D”,“M、P、S、T、H、Y”,分别记作X1、X2、X3,使用步骤3.1)至3.3)计算S的残基组成特征、残基过渡特征、残基分布特征;

X X

6)根据步骤2)至5),得到S的残基组成特征、残基过渡特征、残基分布特征,组成S的特征向量,记作fea;

7)搭建双向长短时记忆循环神经网络框架,该双向长短时记忆循环神经网络框架共有两个部分组成,第一部分是由两个两层的双向长短时记忆循环神经网络LSTM‑BRNN、一络LSTM个线性层FC、一个归一化层BN、一个Tanh层组成;第二部分是由两个两层的双向长短时记忆循环神经网‑BRNN、三个线性层FC、三个归一化层、三个Tanh层、一个Softmax层组成;

8)从PDB库中收集已有蛋白质与蛋白质接触位点标签的蛋白质序列,记作其中, 表示Dataset中的第i对蛋白质序列,Yi表示 的是否相互作用标签,i=1,2,…,N,N是蛋白质序列对的总数;

9)根据步骤2)至5),生成所有 的特征向量,记作 其中,i=1,2,……,N,N是蛋白质序列对的总数,与对应标签Yi组成样本集合

10)使用步骤7)搭建的双向长短时记忆循环神经网络框架在S上学习预测模型,记作LSTMMergeLinear;

11)将待测蛋白质SA,SB经过步骤2)至5)生成对应的特征向量,将其特征向量输入到训练好的模型LSTMMergeLinear中,得到蛋白质SA,SB是否相互作用的概率值,设定阈值为value,当输出概率值大于value时,则SA与SB是相互作用的,反之则为非相互作用。