利索能及
我要发布
收藏
专利号: 2023111569053
申请人: 广东工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-10-10
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于剪枝预训练模型与人工特征编码融合的4mC位点识别方法,其需要包括以下步骤:S1:获取DNA-4mC的核苷酸序列集L,通过Kmer编码将序列集L转化为数值向量集M;

S2:将预训练模型 DNABert进行剪枝压缩操作得到的模型DNABert-Pruning作为基准模型,训练得到有关序列集L的深层特征信息;具体为:预训练模型DNABert将数字向量集M映射成序列特征数字向量的形式,从而将每个序列表示成特征矩阵;通过删除预测是否相邻下一句的训练任务、调整序列长度来使模型能够在DNA序列场景中更好地进行连续k个标记核苷酸片段的预测,对于每个子序列,随机屏蔽构成序列15%的k个连续标记的区域,并让DNABert模型基于剩余顺序预测屏蔽序列,确保足够的训练示例;

S3:根据CKSNAP编码特征方式扩充各核苷酸在序列集L中的特征表示空间,通过双向LSTM网络训练得到序列集L的浅层特征信息,具体为:利用CKSNAP编码对序列中间隔k个核苷酸的Kmer核苷酸对重新排列,使用Embedding层将其从原先所属的空间映射到新的多维空间中获取进一步的特征表示,同时利用双向LSTM网络解决序列在训练过程中的梯度消失和梯度爆炸问题,得到所构建的人工编码特征模块去提取基因组序列中的浅层机器特征信息;

S4:将上述训练得到的浅层特征信息与深层特征信息同时输入到特征融合注意力模块中,得到更为准确的融合特征表征,具体为:采用注意力融合策略将所述步骤S2和S3中的所训练完的特征准确地融合两者之间的语义和尺度;其中注意力融合策略使用具有不同尺度的两个分支提取通道注意力权重的模块,一个分支使用GlobalAvgPooling来提取全局特征的注意力,另一个分支直接使用逐点卷积来提取局部特征的注意力;注意力融合策略用公式表示为:公式中X, Y分别是预训练模块的特征和人工编码模块所训练出的特征, M(·)表示通过不同尺度的分支后产生的注意力权重, “+”表示初始特征集成, “*”表示按元素乘法使得网络能够在X和Y之间进行软选择或加权平均,融合权重M(X+Y)由0和1之间的实数组成,最终得到融合特征Z;

S5:对融合后的表征特征使用前馈神经网络和Sigmoid函数输出识别预测,计算其分类评分。

2.根据权利要求1所述的4mC位点识别方法,其特征在于:所述步骤S1中的数据集获取4

部分,其具体的获取方式为:从MethSMRT数据库中收集了6个相关物种基因组中N -甲基胞嘧啶位点作为DNA-4mC位点识别数据集,其中这六个不同物种分别是大肠杆菌、地杆菌、地碱杆菌、秀丽隐杆线虫、拟南芥和黑腹果蝇;序列长度取41bp,根据甲基组分析技术注释,所有4mC位点的修饰置信度必须为30或更高,同时排除了那些序列相似度超过70%的4mC位点,使用CDHIT软件计算相似度得分;在这些质量检查步骤之后,获得了一个非冗余的、经实验鉴定的核苷酸序列集L;对于序列中的除A,T,C,G的未知碱基采取删除这个序列的方式得到实验所需的数据集,同时还保证独立测试集中的样本序列并不会出现在训练数据集中。

3.根据权利要求1所述的4mC位点识别方法,其特征在于:所述步骤S1中的Kmer编码部分,Kmer是指将所研究的核苷酸序列分成包含k个碱基的字符串,长短为m的核苷酸序列可以分成(m-k+1)个kmers,如果k=2,则计算的为双核苷酸频率,具体定义为:其中N(t)是Kmer编码后t的次数,N是核苷酸序列的长度;通过Kmer编码将原始的DNA核苷酸序列集L转化成计算其核苷酸频率数值变量的形式来组成数字向量集M。

4.根据权利要求3所述的4mC位点识别方法,其特征在于:所述步骤S2中的剪枝预训练模型DNABert-Pruning获取深层特征,具体为:采用剪枝压缩的技术对原始DNABert预训练模型进行操作,修剪部分不必要的神经元或者整个神经元层来减少复杂性,同时也能够避免性能衰减和过拟合现象,减少其训练成本,利用DNABert-Pruning模型对定长的DNA序列进行预训练,提取基因组序列中的深层机器特征信息。

5.根据权利要求4所述的4mC位点识别方法,其特征在于:所述步骤S3中的CKSNAP编码部分,具体为:CKSNAP编码包含由任意k个核苷酸隔开的核苷酸对的出现情况;K间隔核苷酸对的组成特征包括16个核苷酸对;以k = 1为例,K间隔核苷酸对的组成可以如下指定:其中,* 表示A、G、C 或 T,N Y*Z表示序列中 Y*Z 核苷酸对的数量,NTotal 表示序列中单间隔核苷酸对的总数;对于 k = 0、1、2,NTotal的值分别为P-1,P-2,P-3,P表示核苷酸序列的长度。

6.根据权利要求5所述的4mC位点识别方法,其特征在于:

其中LSTM网络引入了细胞状态来维护前后时刻的信息传递,通过三个“门”结构来去除或增加信息进行维护的;“门”是一种让信息选择式通过的方法,三个“门”结构分别为遗忘门,输入门和输出门;

遗忘门是通过上一时刻的隐状态 与当前时刻的输入 来决定需要保留多少上

一时刻的细胞状态信息,具体定义为:

其中, 来表示上一时刻学到的信息保留程度, 表示网络模型权重, 为偏置项, 为上一时刻的隐状态, 为当前时刻的输入, 为激活函数,将隐状态与输入向量的变换结果映射到 (0,1) 范围之内;

输入门具体定义为:

其中, 表示网络模型权重, 为偏置项, 为上一时刻的隐状

态, 为当前时刻的输入, 为更新的信息权重,tanh为双曲正切激活函数,用来进行非线性变换创建一个新的候选向量 ;

最终通过结合遗忘门与输入门选取信息进行细胞状态的更新,具体定义如下:

此时 即为下一时刻的细胞状态;最终利用上一时刻的隐状态 与当前时刻的输入 来计算出需要更新的信息权重 来决定需要保留多少细胞状态,同时基于当前时刻的细胞状态 决定输出值,即隐状态 ;具体定义如下:其中 为更新的信息权重, 为激活函数, 表示网络模型

权重;

LSTM网络通过三个“门”结构之间的累加来维护细胞状态的更新,最终控制隐状态的输出来解决梯度消失导致的长期依赖问题。

7.根据权利要求6所述的4mC位点识别方法,其特征在于:所述步骤S5中使用前馈神经网络和Sigmoid函数输出识别预测,其中前馈神经网络具体定义为:其中 表示神经网络的层数, 为  层到第 层的权重矩阵, 表示第

层神经元的输出 表示  层到第  层的偏置, 表示第 层神经元的激

活函数;

其中Sigmoid函数具体定义为:

前馈神经网络将输入数据映射到相应的类别,再通过Sigmoid函数将其映射到0和1之间的概率值,输出值大于或等于0.5可以被解释为正类,小于0.5可以被解释为负类,实现最终的分类效果。

8.根据权利要求7所述的4mC位点识别方法,其特征在于:所述步骤S5中计算分类评分,对结果进行优化,采用了交叉迭代熵作为损失函数,计算预测结果与真实值的loss;通过Adam作为梯度优化器,优化全局的网络参数。