利索能及
我要发布
收藏
专利号: 2022105708285
申请人: 南京邮电大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-16
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于序列特征的植物长链非编码RNA预测方法,其特征在于:所述方法包括正负数据集构建去冗余、序列k‑mer频率特征提取、特征融合与选择以及分类器对比;

其中,正负数据集的构建去冗余消除序列相似性对预测结果造成的影响,序列特征提取实现对基因序列k‑mer特征的提取,特征融合是在序列k‑mer频率特征提取的基础上加入序列长度特征和序列GC含量特征后将这三类特征进行融合,接着使用卡方检验进行最优特征选择,根据不同特征的p‑value值选出最优特征组成特征子集,再将最优子集特征输入梯度提升决策树分类器以解决植物lncRNA的识别分类问题;

所述方法具体包括以下步骤:

步骤1,给定正负样本数据集对它们进行去冗余处理,保留相似性低于60%的基因序列;

步骤2,给定去冗余后的正负样本数据集提取序列GC含量特征和序列长度特征;

步骤3,给定去冗余后的正负样本数据集提取k‑mer子序列;

步骤4,根据TF‑IDF算法对正负样本数据集的每个k‑mer子序列计算它的重要程度,计算结果为该k‑mer的频率特征;

步骤5,将正负样本数据集对应的k‑mer频率特征、步骤2提取的序列GC含量特征和序列长度特征拼接组合起来得到初始特征;

步骤6,采用卡方检验从包含所有正负样本初始特征的特征集中选择出最能区分正负样本的特征子集,这些特征子集称为最优特征子集;

步骤7,将选择出来的最优特征子集作为输入投入分类器进行分类得到最终的分类结果;

所述步骤7中的分类器为梯度提升决策树GBDT分类器;

GBDT的梯度迭代算法中,令T={(x1,y1),(x2,y2),…,(xn,yn)},x=(x1,...,xn)为输入的训练数据集,GBDT的算法模型为:其中,x代表输入,αt是第t棵树的权重,ht(x)代表第t棵分类回归树,T是梯度提升决策树中构建的树的数量;梯度提升决策树算法采用前向分布算法,先确定模型的初始值F0(x)为常数,第m步的模型公式是:Fm(x)=Fm‑1(x)+αmhm(x)

其中,Fm‑1(x)为当前模型;新添加的分类回归树hm(x)通过最小化损失函数求得:其中,N代表样本的个数;yi是输入数据集中xi对应的标签值,当xi属于正类yi=1,否则yi=0;L代表损失函数,在GBDT的二分类模型中,L一般用对数函数表示,表达公式为:L(y,F)=log(1+exp(‑2yF))

GBDT算法采用梯度下降法获得最优解,梯度下降方向为损失函数L在当前模型Fm‑1(x)的负梯度值:其中, 代表在损失函数L中针对F(x)求它的梯度下降方向,即对损失函数L求偏导;αm通过线性搜索得到,计算公式为:通过学习率v调控梯度提升决策树的正则化,则计算公式为:

Fm(x)=Fm‑1(x)+v αmhm(x)

其中,v代表此模型的学习率,v∈(0,1];学习率控制模型的参数优化速度和效果,学习率越小,模型优化速度越慢。

2.根据权利要求1所述一种基于序列特征的植物长链非编码RNA预测方法,其特征在于:步骤3中,k‑mer指的是一个测序序列中长度为k个碱基的子序列;子序列中每个位置上

1 2 3 k

的碱基是A、U、C、G四个碱基中的任意一个,k‑mer子序列总个数为4+4+4 +...+4,k为正整数。

3.根据权利要求1所述一种基于序列特征的植物长链非编码RNA预测方法,其特征在于:步骤4中,计算公式为:Fi=tfij*idfi

其中,tfij表示第i个k‑mer子序列在某数据集第j条序列中出现的频率;ni,j表示在该数据集第j条序列中第i个k‑mer出现的次数;∑knk,j表示该数据集第j条序列中所有k‑mer出现的次数,k的取值范围为k=1,2,3,4…,k为正整数;idfi表示第i个k‑mer子序列在该数据集的所有序列中出现频率的对数;|D|表示某数据集中所有序列的个数;|j:ti∈dj|表示包含第i个k‑mer子序列的序列个数;Fi表示第i个k‑mer子序列频率特征值。