利索能及
我要发布
收藏
专利号: 2024118289541
申请人: 北京工业大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-09-30
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于全局交互传递性与特征融合的多层调控网络关键节点识别方法,其特征在于,包括以下步骤:步骤1:数据下载与预处理;从TCGA数据库中下载癌症的RNA‑seq,包括mRNA、lncRNA和TF,以及成熟miRNA的Isoform‑Seq基因表达数据和临床样本数据,并对所有节点的表达数据进行logCPM归一化处理;

步骤2:差异分析;使用R软件包"Deseq2"对相邻正常样本和I期癌症样本之间的mRNA、miRNA和lncRNA进行差异分析,根据实验数据库Hocomocov11和Animal TFDB整理了人类TFs,并从差异mRNA中筛选出差异TFs;

步骤3:构建miRNA‑mRNA调控关系对;根据4个生物实验数据库mir2disease、miRecords、TarBase、miR2Disease和1个预测数据库StarBase,将上述数据库中获得的相互作用关系对进行交叉得到miRNA‑mRNA调控对;

步骤4:构建miRNA‑lncRNA调控关系对;利用生物实验数据库LncBase和预测数据库StarBase获得的相互作用关系对进行交叉得到miRNA‑lncRNA调控因子对;

步骤5:构建mRNA‑TF相互作用对;将生物实验数据库TRRUST和预测数据库hTFtarget这两个数据库交叉得到mRNA‑TF相互作用对;

步骤6:网络可视化;利用CytoscapeV 3.7.1构建四类节点的lncRNA‑miRNA‑mRNA‑TF ceRNA调控网络并将其可视化;

步骤7:网络节点的特征值计算和特征选择;选择计算网络中节点的度、边缘渗透分量、瓶颈中心性、紧密度中心性、径向度中心性、介数中心性和应力中心性等7个拓扑特征和节点的变异系数和表型相关性这2个生物特征,对上述特征进行筛选后用于后续分析;

步骤8:构建Bayes‑PageRank重要性指标,即BPR;通过评分搜索算法从上述构建的lncRNA‑miRNA‑mRNA‑TF调控网络中学习贝叶斯网络结构,将步骤8中筛选出的特征单独或随机组合放入无监督贝叶斯模型中进行参数学习,采用最大似然估计进行参数估计和变量消除算法进行推理得到节点的条件概率值,将其作为“weight”输入到PageRank算法中,从而构建具有单个特征或组合特征的各种BPR指标;

Bayes算法中节点的条件概率值计算公式如下:

P(Inf)=∏P(Inf|Attr)

其中P(Inf|Attr)表示表示给定某一特征时节点的条件概率值;P(Inf)表示节点所有特征的联合概率乘积,即基因重要性值;P(Inf|Attr)表示表示给定某一特征时节点的条件概率值;

PageRank算法的计算公式如下:

其中Pi(trf)代表节点i的重要性,M(i)代表与其他基因i相连的基因集合,Rij代表节点i和j之间的皮尔逊相关系数,degree(j)代表基因j的度,n代表与节点i交互的节点数,d表示节点i与其他相邻节点交互的概率,一般设为0.85;

步骤9:获得最优BPR重要性指标;通过RNADisease 4.0数据库筛选与癌症相关的经实验验证的miRNA、mRNA含TF和lncRNA分子,并将这些分子标记为阳性样本,将其他分子标记为阴性样本;基于ROC曲线计算每个BPR指标的AUC值,评估步骤8中所有BPR指标对阳性样本的预测能力,比较不同指标的AUC值,并选出最优BPR指标,即BPR‑best;

步骤10:评价最优BPR指标和疾病关键节点的相关性;基于最优BPR指标计算ceRNA调控网络中各节点的BPR值,分析不同BPR值范围内阳性样本所占比例,即幂律分布;

步骤11:最优BPR指标与其他单特征或多特征指标在贝叶斯模型和随机森林模型中预测能力的比较;

步骤12:关键节点筛选及文献验证;选取最优BPR指标排名前5%的节点作为关键节点,利用文献验证其与癌症发生发展的相关性。

2.根据权利要求1所述的一种基于全局交互传递性与特征融合的多层调控网络关键节点识别方法,其特征在于步骤2中,对mRNA、miRNA和lncRNA进行差异分析时,阈值|log2(FC)|≥1,adj.p≤0.05。

3.根据权利要求1所述的一种基于全局交互传递性与特征融合的多层调控网络关键节点识别方法,其特征在于步骤3、4、5中,从各种数据库中收集关于lncRNA,miRNA,mRNA和TF之间相互作用的数据,mir2Disease,miRecords,Tar Base和miRTarBase,LncBase主要从生物实验中收集数据,StarBase主要通过计算机算法进行预测;本研究从StarBase数据库中筛选出至少经过三种算法预测的相互作用关系对,结合多个实验验证数据库和预测结果数据库,更全面地收集和整合关于miRNA‑mRNA、TF‑mRNA、miRNA‑lncRNA调控关系的信息。

4.根据权利要求1所述的一种基于全局交互传递性与特征融合的多层调控网络关键节点识别方法,其特征在于步骤6中,为了减少所得到的调控关系对的假阳性,用皮尔逊相关系数来计算上述关系对与配对样本中基因表达的相关性;由于结合能力弱的TFs表现更强的协同效应,所以对上述关系对选择了不同的阈值;在miRNA‑mRNA和miRNA‑lncRNA中,保留了所有p值<0.05的负相关对,即miRNA对lncRNA和mRNA的负调控;在TFs‑mRNA中,保留了|r|≥0.2、p‑value<0.05的相互作用对;此外,还计算了表型相关性,取值为0或1,保留了相关性r≥0.1且p值<0.05的节点。

5.根据权利要求1所述的一种基于全局交互传递性与特征融合的多层调控网络关键节点识别方法,其特征在于步骤7中的计算公式如下:(1)度—Degree,Deg:

Deg(v)=|N(v)|

节点的度越高,该节点相连的节点越多,代表其重要性越高;

(2)边缘渗透分量—Edge Percolated Component,EPC:

边缘渗透分量是基于节点在网络中的位置和连接性来识别网络社区的方法,它不是基于单个节点的度,而是基于节点集合的连通性;EPC的值越高表示该节点所连接的其他节点更倾向于彼此之间相互连接,节点越重要;

(3)瓶颈中心性—Bottleneck,BN:

BN(v)=∑s∈Vps(v)

瓶颈中心性通过计算节点在网络中不同节点对之间最短路径中作为瓶颈的频率来评估节点的重要性;节点在更多最短路径中作为瓶颈出现的次数越多,则其瓶颈中心性值越高,被认为在网络中更为重要;

(4)紧密度中心性—Closeness,Clo:

Clo值越高,表示节点到网络中其他节点的平均距离越短,节点在网络中的中心性越高;

(5)径向度中心性—Radiality,Rad:

径向度中心性是基于节点到网络中心的距离来评估节点的中心性,通常是所有节点到中心的平均距离最小化;径向度分数是节点到网络中心的距离的倒数;RD越高,表示该节点到达网络中其他节点的路径越短,具有更好的连接性和可达性;

(6)介数中心性—Betweenness,BC:

介数中心性是基于节点在网络中所有节点对之间最短路径上的出现频率来评估节点的重要性;BC得分越高,说明经过该节点的最短路径数量越多,该节点的重要性程度越高;

(7)应力中心性—Stress,Str:

Str(v)=∑s≠t≠v∈C(v)σst(v)

应力中心性考虑了节点到其他节点的最短路径之和,因此节点的应力中心性值越高,表示该节点在网络中的连接性越重要;

(8)变异系数—Coefficient of Variation,CV:

变异系数可以用来表示基因表达的离散程度;CV值越大,意味着在不同组织、疾病状态或处理条件下,该基因的表达水平变化较大,可能与特定生物学过程或疾病状态相关联;

(9)表型相关性—Phenotypic Correlation,Corr:

表型相关性用于描述基因表达水平与表型之间的关联程度;Corr值大,表示基因或生物特征与特定表型之间存在较强的关联,可能表明这些基因在引起或调控该表型方面起着重要作用;

高度相关的特征共存会导致这些特征所包含的信息权重过高,进而导致其他特征所包含的信息损失越来越大;为了避免这种情况,我们采用了斯皮尔曼相关性分析方法来计算这些特征之间的相关性,如果存在相关性较高的特征,则只选择其中一个特征来建立模型。

6.根据权利要求1所述的一种基于全局交互传递性与特征融合的多层调控网络关键节点识别方法,其特征在于,步骤8中将多种网络拓扑特征和生物特征作为贝叶斯的先验知识,对数据进行约束和正则化,有效减少过拟合风险;在PageRank公式中,节点i的重要性由其所有相邻节点的重要性通过它们之间的交互作用获得,相邻节点j的重要性也会接收到其周围的所有交互,然后通过它们之间的交互将重要性传递给节点i;通过将Bayes算法得到的条件概率值作为“weight”加入到PageRank算法中,优化节点之间重要性的传递规则,提高节点重要性评估的准确性和稳定性。

7.根据权利要求1所述的一种基于全局交互传递性与特征融合的多层调控网络关键节点识别方法,其特征在于步骤11中通过比较各种指标在模型中预测效果,主要采用受试者工作特征曲线下面积—AUC、灵敏度、特异度、约登指数和准确度来评价不同模型的预测性能,P值小于0.05视为具有统计学意义。