北京基因组所(国度生物信息中心)合作颁发多表型全基因组集成分析新步骤
全基因组关联钻研(Genome-wide association study, GWAS)是钻研人类复杂表型遗传成分的有效步骤?蒲Ъ颐且牙GWAS发现了大量的遗传易感位点,阐了然人类复杂表型的多基因性本征,美满了精准医学的主题理论,构建了数千种疾病的遗传风险评估模型,并为多项临床转化类钻研提供了明确的分子靶标。然而,由于无法同时辰析多个表型,尺度的GWAS流程不能高效检出拥有多效性的遗传变异。随着人类复杂表型钻研体量的与日俱增,若何高效集成分析大量表型亟待解决。
相较于使用个别数据的多表型集成分析步骤,基于GWAS汇总数据的步骤在多队列合作钻研中不受个别数据分享限度,同时受队列特异性影响也更幼,因而利用领域更广,但也面对统计学和推算机科学领域的多项挑战。例如必要推导对多表型效应高度敏感的统计量,思考由遗传和非遗传成分导致的表型间复杂关联关系,校对由多重迭代和样本重叠等成分导致的统计量膨胀,同时在分析大量GWAS的情况下,还要对算法的复杂度、并行化规划和内存占用进行优化。
2022年12月20日,北京基因组所(国度生物信息中心)原刘凡钻研组与荷兰伊拉斯谟大学Manfred Kayser团队合作在Nature Communications上颁发了题为“Combining Genome-wide Association Studies Highlights Novel Loci Involved in Human Facial Variation”的文章,该钻研研发了用于集成分析多GWAS的高效算法C-GWAS(Combine GWAS),提供了高度并行优化的开源R软件包,同时通过大规模推算机仿照,展示了C-GWAS对遗传多效性的高检出率和在分歧遗传结构下的高不变性,进而利用C-GWAS分析了78幼我类面部状态表型,新发现并验证了一批影响面部状态的遗传变异和职能性基因,加深了对人类多维复杂表型遗传结构的理解。
在步骤设计层面,作者对多维GWAS统计量组成的有关性矩阵进行了分化,来分辨由可诠释遗传成分导致的 “效应有关性” 和由不成诠释与非遗传成分导致的 “布景有关性”,进而凭据效应和布景有关性相对强杜着选相宜的统计量进行集成分析,同时引入自适应迭代算法以甄别部门遗传变异仅对特定表型子集有效应的情况,从而实现对遗传多效性检出率的最大化。为了克服由于多重迭代优选引起的统计量膨胀,作者通过推算机仿照获得统计量在零如果下的真实散布,并利用其与均一散布的对应关系,对最终观测到的统计量进行校对,确保了C-GWAS了局和尺度GWAS了局可直接在一样显著阈值下进行比力。通过大规模数据仿照发现,与多衷熹它步骤相比,C-GWAS在分歧复杂场景下的统计功效和不变性均展示出显著提升。
人类面部状态代表了一组多维、可遗传且互有关联的复杂表型。作者利用C-GWAS集成分析了78个面部状态的GWAS,了局显示C-GWAS的检出率是传统步骤的3倍,并发现了17个影响脸型的新遗传位点。通过进一步的验证分析和职能基因组学分析,作者展示了C-GWAS的了局比传统步骤的了局拥有更高的遗传多效性,显著提升了脸型可被遗传成分化释的比例,且所指向的靶基因拥有更明确的生物发育学职能,讲了然C-GWAS在解析多维复杂表型遗传结构中的优势。
在新发现的17个影响面部状态的遗传位点中,有13个位点位于颅神经嵴细胞(Cranial neural crest cells, CNCC)中活性调控元件左近,或在垂体等多个组织中阐发出与基因表白eQTL信号的高度共定位。其中,与面部宽度和长度有关的CDK2AP1内含子中的多态性rs10773002,其左近的调控元件在CNCC中调控CDK2AP1的表白,且该位点在多组织中与CDK2AP1的eQTL高度共定位,CDK2AP1编码的蛋白在细胞周期、胚胎干细胞分化和表观遗传调控中阐扬作用。这些证据提醒该位点通过调控CDK2AP1的表白参加到面部状态形成的过程中。
综上,C-GWAS是一种不依赖个别数据对多表型GWAS汇总数据集成分析的高效算法,对遗传多效性有较高的检出率并在复杂场景下有很强的不变性。作者提供了高度并行优化的开源R包,可在数幼时内集成分析数百个GWAS汇总数据。C-GWAS在人类面部状态数据上的利用成功发现了一批新位点和职能基因,加深了对人类面部状态的遗传结构的理解。将来C-GWAS将被用于解析更高维复杂表型的遗传结构,为多表型间共享遗传成分网络的描述提供技术支持。







