1.一种基于模糊k‑mer使用率鉴定lncRNA的方法,其特征在于:具体包括如下步骤:步骤1,对RNA序列数据进行预处理;
步骤2,对传统k‑mer和模糊k‑mer进行定义,并计算传统k‑mer使用频率;
所述步骤2的具体过程为:
t
传统k‑mer的定义为:传统的k‑mer记为U={uj},1≤j≤N=4,序列长度为t;
模糊k‑mer的定义为:模糊k‑mer记为 序列长度为n,其中不能匹配碱基序列的长度为n‑x,x个位置有碱基,x必须小于n;
传统k‑mer使用频率的计算过程为:在滑窗内的序列和特定序列i匹配,则特定序列i的使用次数Ni则增加1,采用如下公式(1)计算k‑mer使用频率Fi:Fi=Ni/Mk (1);
其中,Mk是长度为k的滑窗能沿着RNA序列滑动的总次数;
步骤3,确定传统k‑mer与模糊k‑mer的对应关系;
所述步骤3的具体过程为:
传统k‑mer和模糊k‑mer的一一对应关系的矩阵AM×N=[ai,j],矩阵A中元素的取值为1或
0:
设x是向量,长度为N,其中元素xj是uj的数量;设y是向量,长度为M,其中元素yi是长度为vi的数量,传统k‑mer和模糊k‑mer的一一对应关系为:y=Ax (2);
步骤4,求解传统k‑mer与模糊k‑mer对应关系矩阵cm;
所述步骤4的具体过程为:
对RNA转录本X,其特征向量为
其中, 为转录本中第i个模糊k‑mer的出现次数;
为k‑mer的数量;
为了求解公式(2)的最小L2范式解,定义核函数为:其中,Nm(S1,S2)表示序列S1和序列S2之间的m个不匹配的模糊k‑mer数量;
其中,r=m1+m2‑2t‑m,b=4;
步骤5,用模糊k‑mer训练预测模型。
2.根据权利要求1所述的一种基于模糊k‑mer使用率鉴定lncRNA的方法,其特征在于:所述步骤1的具体过程为:
从RefSeq数据库下载人类编码蛋白的转录本mRNA序列和注释,从GENCODE v17收集人类长链非编码RNA,将带有putative、predicted、pseudogene注释的mRNA和lncRNA排除掉。
3.根据权利要求1述的一种基于模糊k‑mer使用率鉴定lncRNA的方法,其特征在于:所述步骤5的具体过程为:首先,使用LIBSVM包中的svm‑scale程序来规范化调整过的使用频率到0到1范围内的数;然后,采用径向基函数为核的支持向量机作为二分类器;使用LIBSVM包中的grid.py脚本获得优化的支持向量机的参数C和核的参数gamma;在参数搜索过程中,采用10倍交叉验证来评估每对C和gamma参数对应的分类模型的性能。