利索能及
我要发布
收藏
专利号: 2021111483903
申请人: 中国矿业大学
专利类型:发明专利
专利状态:已下证
更新日期:2024-12-10
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

6

1.一种融合基因组特征的mA甲基化局部功能谱分解方法,其包括以下步骤:步骤(1):基于国家生物信息中心(National Center for Biotechnology Information,NCBI)的序列阅读档案(Sequence Read Archive,SRA)数据库获取原始测序6

样本,每组样本均包括对应的输入控制数据及免疫沉淀数据,提取上述两组数据中mA位点的读段数。

6

步骤(2):构建各组样本的mA位点甲基化水平矩阵PN×M={pij}和表达水平矩阵WN×M={wij},1≤i≤N,1≤j≤M,对W做最大最小归一化使其取值范围为[0,1]。其中,N为样本数目,6 6

M为m A位点数目,pij和wij分别对应于第j个m A位点在第i个样本中的甲基化水平和表达水平。

6

步骤(3):基于mA位点的基因组特征,利用斯皮尔曼秩相关系数构建相关系数绝对值大6

于0.8的极强相关mA位点之间的相关性矩阵,表示为GM×M={gij},1≤i,j≤M。

6

步骤(4):构建融合基因组特征的mA甲基化局部功能谱模型,如式(1)所示。

6

其中AN×N={aij}表示待求解的混淆矩阵;SN×M={sij}表示调控通路中mA位点的作用矩6

阵,其中sij对应于第j个m A位点在第i个调控通路中的作用程度;α用于调节相关性矩阵的融合权重,其取值范围为0≤α≤1。

‑1

步骤(5):引入辅助矩阵X'=(P*W)·[αI+(1‑α)G] ,利用主成分分析对X'白化处理,如式(2)所示。

其中VN×N={vij}表示白化矩阵,DN×N={dij}是由辅助矩阵X'中各行间的方差矩阵的特征值构成的对角矩阵,EN×N={eij}是相应的特征向量的正交矩阵。

步骤(6):经过白化处理后,方法转化为求解Z=VAS中的矩阵A及矩阵S。令Y=WZ,其中W‑1 ‑1

=A V ,采用基于负熵的估计方法,对Y中的独立成分逐一求解。假设当前求解的是yi,对应于Y中的第i行(即第i个独立成分),1≤i≤N,本方法中采用的负熵近似表达式如(3)所示。

2

J(yi)=[E{G(yi)}‑E{G(v)}] (3)其中,v是与yi具有相同方差的高斯变量,非二次函数G如式(4)所示。

其中,a为常数且1≤a≤2。求解yi的具体步骤如下:第一步,假设当前求解的是对应第i个独立成分中的第k个解混元素wik,1≤i,k≤N。求式(3)的梯度,可得负熵近似表达的梯度算法如式(5)所示。

其中,r=E{G(yi)}‑E{G(v)},Wi·是矩阵W中的第i个行向量(解混向量),Zk·是矩阵Z中的第k个行向量,函数g是非二次函数G的导数,g(y)=tanh(ay)。wik的更新如式(6)所示。

其中, 为wik更新后的值,函数g'是函数g的导数(非二次函数G的二次导数),g'(y)=2

a(1‑tanh(ay))。

第二步,同理可更新Wi·中的其他(N‑1)个解混元素,重复第一步及第二步,直至Wi·收敛,Wi·的收敛条件如式(7)所示。

其中,ε是人为预设的一个很小的正数, 是当前轮更新后的第i个解混向量,Wi·是上一轮的第i个解混向量。

步骤(7):对解混向量W(i+1)·正交化处理,以提取第i+1个独立成分yi+1,如式(8)所示。

其中 是由已经估计出的i个解混向量W1·,W2·,...,Wi·构成的矩阵,它的列依次对应这i个向量。

步骤(8):重复步骤(6)及(7)完成Y中所有独立成分的提取,利用柯尔莫可洛夫‑斯米洛夫检验(Kolmogorov–Smirnov test,KS test)对各独立成分进行正态性检验。

6

步骤(9):Y=WZ,估计Y中各独立成分对应的概率密度,提取95%置信区间以外的mA甲6

基化位点集合作为敏感位点,因而每个独立成分可提取出两个mA甲基化局部功能模块。

6

2.根据权利要求1所述的融合基因组特征的mA局部功能谱分解方法得到的独立成分矩6

阵Y,其中yij表示预测的第j个mA位点对第i种生物功能的响应水平。