1.交互融合特征表示与选择性集成的DNA结合蛋白识别方法,其特征包括如下步骤:交互融合的特征表示与选择性集成分类器,其中所述的交互融合的特征表示是利用物化属性与进化信息之间的交互效应,和非相邻残基间的位置信息,充分挖掘隐藏在蛋白质序列背后的潜在的生物信息,生成具有强判别能力的特征;所述的选择性集成分类器是通过对特征表示的参数进行扰动,生成不同的输入特征空间,并使用选择或修剪策略得到具有差异性的基分类器,投票集成得到具有强泛化能力的整体分类器。
2.如权利要求1所述的方法,其特征在于,所述的交互融合的特征表示是根据序列中的数学关系以及生物化学属性,将由字符组成的序列,数值化成一个固定维数的特征向量,针对蛋白质序列数据,采用交互融合特征表示模型,从而能够同时考虑不种物化属性和进化信息自身内部的相关性,以及物化属性与进化信息之间的交互效应,其中所述的进化信息的得分矩阵(P)是一个行数为序列长度(L),列数为20的得分矩阵:其中,元素pi(j)表示蛋白质进化过程中蛋白质序列第i个位置的氨基酸残基Ri突变为第j类氨基酸的概率,其中,1≤i≤L,1≤j≤L。
3.如权利要求2所述的方法,其特征在于,所述的物化属性的得分矩阵(Q)是一个行数为序列长度(L),列数为M的得分矩阵:其中,任一条蛋白质序列S可表示为 其中L是序列长度,M是所使用物化属性的个数,qi(j)是序列中第i个氨基酸残基Ri的第j种物化属性指数,其中,1≤i≤L。
4.如权利要求2所述的方法,其特征在于所述的交互融合的特征表示中得分矩阵λ-gapSM的定义形式为:其中Al=(aij)(L-λ)×L为(0-1)矩阵,aij∈{0,1},其中参数λ表示矩阵Al中任一行向量ai中两个非零元1之间的距离(λ-gap),其中,1≤λ≤L-1。
5.如权利要求4所述的方法,其中所述的λ-gapSM表示方法包括如下步骤:输入:待查询蛋白质序列seq_FASTA,跳空距离λ输出:数值型特征向量v
(1):初始化L为蛋白质序列seq_FASTA的长度,跳空距离λ≤L-1(2):调用PSI-BLAST,得到进化信息的得分矩阵P:P=(pi(j))L×20(3):利用氨基酸指数表AAindex,可得到物化属性得分矩阵Q:(4):水平拼接矩阵P和矩阵Q:W=[P&Q]=(ωij)L×(20+M)(5):由λ-gap得分矩阵定义,计算得到矩阵Gλ:Gλ=AλW=(gij)(L-λ)×(20+M)(6):计算协差矩阵Σ:
(7):对Σ按行向量进行拉直操作,保留i≤j的元素sij,返回行向量:v=(σ1,1,σ1,2,…,σ1,20+M,σ2,2,…,σ2,20+M,…,σ20+M,20+M) 。
6.如权利要求5所述的方法,其中所述的选择性集成分类器包括如下步骤:给定蛋白质序列集,随机划分训练集Strn,验证集Sval和测试集Stst,假设 为对应于Strn的训练集,其中任一训练样本 的输入变量 是由权利要求5的方法得到的跳空距离为λ的p维特征向量,输出变量为yi∈Y={-1,+1},并由此方法得验证集 和测试集 在 上训练基分类器Cl,构成集合T={C1,C2,…,CL-1}, 为T的任一子集,计算子集 对应的集成基分类器在相应的验证集 上的泛化误差 选取泛化误差最小的子集
7.如权利要求6所述的方法,其特征在于GapIFFR-SE的方法包括如下步骤:输入:训练序列集Strn,校验序列集Sval,测试序列集Stst,基分类器算法C,评估标准M,集成基分类器个数k;
输出:测试序列集Stst的类别标签Y;
(1)初始化过程:
─设置T为空集Φ,L为序列集中的最短长度,调用权利要求6的算法计算得到Dtrn(λ),Dval(λ)和Dtst(λ),其中权利要求6的算法中λ-gapIFFR的输入参数λ=1,2,…,L-1(2)基分类器训练过程:─For i=1,2,...L-1do
──更新T为T∪Ci,其中Ci为分类算法C在训练数据集Dtrn(i)上训练所得的基分类器─EndFor(3)选择过程或剪枝过程:
─For j=1,2,...L-1do
──在校验数据集Dval(j)上计算基分类器Cj∈T的评估值Mj.
─EndFor
─对Mj进行降序排列,选择T的子集 其中Cλ1,Cλ2,…,Cλk对应于排名靠前的k个Mj值;
(4)多数投票集成过程:
─对测试数据集Stst的类别标签进行预测,
其中Cλt是第λt个基分类器在数据X∈Dtst(λt)上的预测结果,返回Y。