利索能及
我要发布
收藏
专利号: 2019104847698
申请人: 南通大学
专利类型:发明专利
专利状态:已下证
更新日期:2026-04-09
缴费截止日期: 暂无
联系人

摘要:

权利要求书:

1.一种基于GPU并行计算的复杂疾病基因互作关联分析方法,其特征在于,包括如下步骤:

步骤一、基于背景控制的主效+上位性检测算法研究,采用两阶段策略:

第一阶段,在所有主效和上位性效应中,剔除无关变量,保留少量变量;

第二阶段,将通过第一阶段筛选的变量放入模型中进行最终确定变量选择方法;

步骤二、建立基于GPU并行计算的加速算法,得到MRMLM‑GPU新方法;

步骤二中,建立基于GPU并行计算的加速算法,得到MRMLM‑GPU新方法的具体步骤为:

①准备一台具有CUDA运算能力的NVIDIA显卡,搭建Python运行环境,Windows系统下可以使用Anaconda、Visual Studio和Ecplise中的一种,安装pycuda包,导入GPU函数pycuda.autoinit、pycuda.compiler、pycuda.cumath、pycuda.curandom、pycuda.driver、pycuda.gpuarray和pycuda.tools;

②利用pycuda.driver.In,pycuda.driver.Out以及pycuda.driver.InOut参数进行简化内存和显存之间的数据拷贝;

③通过SourceModule()函数,在函数内用__global__标识符设置线程数量以及线程组织形式,以期将SNP标记批量的分配到线程中,调用syncthreads()函数,使同一块中的线程同步;

④直接在GPU上重新编写执行最优化函数optim,即用GPU函数调用GPU函数;

⑤初筛过后,进入多位点模型的标记个数小于等于3000,然后,多位点模型,标记之间不是相互独立的,进行局部GPU并行计算,涉及到矩阵运算的操作移植到GPU上运行。

2.根据权利要求1所述的基于GPU并行计算的复杂疾病基因互作关联分析方法,其特征在于,所述第一阶段的具体步骤包括:

1)第一阶段变量初筛:在单位点筛选的时候,引入背景控制的思想,将每个SNP标记当成随机效应,同时进行多基因背景控制,把遗传方差剖析为主效效应+主效多基因背景+误差方差三个方差分量,建立混合线性模型,然后在混合线性模型的基础上考虑上位性,则遗传方差剖析为主效效应+上位性效应+主效多基因背景+上位性多基因背景+误差方差五个方差分量,对MRMLM中的变量初筛进行背景控制,对包含上位性的五个方差分量进行快速求解;

2)第一阶段初筛阈值的选取:设定P=0.01,并结合BIC准则确定。

3.根据权利要求1所述的基于GPU并行计算的复杂疾病基因互作关联分析方法,其特征在于,所述第二阶段的具体步骤为:将通过初筛的SNP标记及SNP‑SNP对进行变量选择,用六种常用的变量选择方法进行对比,通过模拟数据,比较最终的统计功效、假阳率和效应值估计指标,从而选择一种最优的变量选择方法。

4.根据权利要求1所述的基于GPU并行计算的复杂疾病基因互作关联分析方法,其特征在于,

步骤一中,初筛阶段使用的模型为:

y=1μ+Qv+Gmβm+Glβl+Zmum+Zlul+ε (1);

其中,y是n×1维数量性状表型向量,n表示样本个体数目;1表示n×1维的单位向量;μ表示表型均值;Q表示n×c维的固定效应矩阵,包括群体结构或者主成分组分、性别和年龄;

v表示c×1维固定效应向量,但不包括截距μ;Gm表示n×1维假定的数量性状QTN主效基因型,βm是假定QTN的主效效应;Gl表示n×1维假定的数量性状两个位点QTNi和QTNj互作基因型,即QTNi和QTNj基因型的叉乘,βl是假定互作基因型效应;Zmum是主效多基因背景,Zm=(zij)n×s是主效多基因背景效应um对应的设计矩阵,s是主效标记个数, 是主效多基因背景方差,Km是主效亲缘系数矩阵;Zlul是互作的多基因背景,Zl=(zi#zj)n×q是互作多基因背景效应ul对应的设计矩阵, 是互作标记个数,是互作多基因背景方差,Kl是互作亲缘系数矩阵; 表示n×1维剩余误差

向量, 是剩余误差方差,In表示n×n维的单位阵;

若群体结构的影响存在,通过数量性状表型观察值与群体结构的回归分析,可剔除群体结构的效应影响,校正后的模型为:基于模型(2),y‑Q的方差可表示为:

通过EMMA算法,可以获得λm和λl的值;Bm为半正定矩阵;

其中,Qm为正交矩阵,Λmr是具有正特征值的对角阵,mr=Rank(Bm),即为矩阵Bm的秩;Qm1和Qm2分别为Qm的子块矩阵,其维度分别为n×mr和n×(n‑mr),0是对应的零块矩阵,同理,可得

5.根据权利要求1或3所述的基于GPU并行计算的复杂疾病基因互作关联分析方法,其特征在于,第二阶段中确定初筛阈值以及变量选择方法的步骤为:先将初筛阈值设定为

0.01,即P<0.01的主效和上位性通过筛选,然后,通过BIC准则来确定初筛保留哪些变量;下面提到的筛选针对主效和上位性分别进行,运用的法则是相同的,如果P<0.01时的变量个数大于3000,初筛分别选择1000,2000和3000,变量进入第二阶段的变量选择,分别计算三种情况下的BIC值,记为BIC1、BIC2和BIC3,选取BIC=min{BIC1,BIC2,BIC3}时为初筛变量的个数;如果P<0.01时的变量个数大于2000、小于3000,记为num(P<0.01),则分别筛选

1000,2000和num(P<0.01)变量进入第二阶段的变量筛选,与P<0.01变量个数大于3000时类似,分别计算三种情况下的BIC值,选取BIC值最小时的变量个数为初筛变量个数;如果P<

0.01时的变量个数大于1000、小于2000,记为num(P<0.01),则分别筛选1000和num(P<0.01)变量进入第二阶段的变量筛选,分别计算两种情况下的BIC值,记为BIC1和BIC2,选取BIC={BIC1,BIC2}时为初筛变量的个数;如果P<0.01时的变量个数小于1000,记为num(P<0.01),则进入第二阶段筛选的变量个数为num(P<0.01);

第二阶段变量选择方法从六种方法里面挑选,分别为LASSO,GroupLASSO,SCAD,SIS,LARS和BayesianLASSO,设置四组模拟,第一组只有上位性效应,第二组包含主效效应+上位性效应,第三组包含上位性效应+多基因背景效应,第四组包含主效效应+上位性效应+多基因背景效应;四组模拟中设置20个上位性位点,其中,遗传率为1%的有10个,遗传率为3%的有10个,第二组和第四组设置10个主效位点,遗传率为1%;第三组和第四组的多基因背景效应遗传率分别设置为5%和10%;通过对模拟数据统计功效和假阳率的综合比较,以及对不同情况的稳定性,来确定第二阶段变量选择方法。