5.2.4 全基因组关联分析
在提出关联研究方法之前,人们主要采用连锁研究方法对复杂疾病/性状的遗传易感性进行研究,取得了一定的成果,并发现了一些易感的疾病和性状基因。然而,由于复杂疾病/性状的明显遗传异质性和表型复杂性,基于家族的“基因组连锁研究”的应用受到限制。1996年,Risch和Merikangas研究显示高于连锁研究的常见复杂疾病关联研究在遗传学研究中有效,并提出了全基因组关联研究的概念。关联研究基于“常见疾病,常见变异”的假设。基本原则是选择特定群体中的病例组和对照组,并比较全基因组范围内所有SNPs的等位基因,或者病例组和对照组之间基因型频率的差异。如果SNPs基因座的等位基因或基因型在病例组中比对照组的差异出现显著变高或变低,那么该位点被认为与疾病相关。然后基于基因组中基因座的位置和连锁不平衡关系推断可能的疾病易感基因。
随着DNA测序技术自动化程度和基因分型通量的日益提高,全世界多个国家的科研机构通过合作,相继完成了国际人类基因组计划(The Human Genome Project,HGP)和人类基因组单体型图(HaplotypeMap,简称HapMap),将人类对于生命本源的认识大大向前推进了一步。2003年,HGP计划的完成为阐明人类基因组序列、解读生命遗传密码提供了研究基因结构和功能的基础。HapMap计划描述和记录不同人群的基因组中常见遗传变异的等位基因和基因型频率及单倍型形式,分别在2005年、2007年和2009年公布了第Ⅰ、Ⅱ、Ⅲ期(Ⅰ,Ⅱ,Ⅲ,Phase)的数据。目前该计划已发现了人类基因组中1 000多万个常见SNPs,构建了人类基因组差异的公众数据库(www.hapmap.org)。HapMap计划为研究者提供了将遗传多态位点(高密度的遗传变异图谱)与特定疾病/性状风险联系的相关信息,那么基因分型技术的快速发展、统计方法的不断改进和统计分析软件为GWAS的发展提供了技术保障。在引入基于HapMap的人类全基因组SNPs检测芯片后,研究人员可以同时检测每个人数十万到一百万个SNPs[18-20];高效统计分析软件的出现使得处理海量分型数据的难题也迎刃而解[21],这些使得GWAS的应用成为可能,从根本上改变了基因研究的“蓝图”,进而为疾病的预防、诊断和治疗提供了新的方法[22,23]。
GWAS(Genome-W ide Association Study),即全基因组关联分析,是指在人类全基因组范围内找出存在的序列变异,即单核苷酸多态性(SNPs),从中筛选出与疾病相关的SNPs。GWAS是在某一特定人群中研究遗传突变和表型之间的相关性。GWAS的理论基础是连锁不平衡定律(linkage disequilibrium,LD),即假设观察到的SNPs与真正的致病突变(causal variant)之间存在很强的LD。基于基因芯片设计的GWAS,目前着重关注人群中的常见变异(common SNPs,通常指最小等位基因频率MAF>0.01),因此通过GWAS发现的疾病易感位点主要集中在常见变异上,即通常所说的“常见疾病,常见变异”(common disease,common variants)理论。GWAS可以将复杂疾病每个微效基因全部扫描出来,对隔离群体中的遗传变异具有更强的检测效力,已经成为研究复杂疾病的强大分析手段。目前已有超过80多种复杂疾病或人类特症的GWAS研究报道[24],如对阿尔茨海默病、乳腺癌、糖尿病、冠心病、肺癌、肥胖、胃癌、精神分裂症、双相情感障碍、重度抑郁症等复杂疾病进行了GWAS研究并找到疾病相关的易感基因(http://www.genome.gov/gwastudies/)。我国科学家也开展了关于中国人群的银屑病、精神分裂症、冠心病等方面的GWAS研究,而且找到与疾病相关的易感基因。这些研究成果大大拓宽了人们对于复杂疾病的遗传机制的理解。
目前的GWAS多采用两个阶段的设计:首先采用覆盖整个基因组的高通量SNPs分型芯片对一批样本进行扫描,然后筛选出最显著的SNPs(如P<10-7)供第二阶段进行扩大样本量。GWAS两阶段研究设计减少了基因分型的工作量和花费,同时通过重复实验降低了研究的假阳性率。GWAS的整体过程比较复杂,其大致流程如图5-3所示。
图5-3 GW AS研究整体过程流程图
目前应用于GWAS的全基因组分型的主流技术平台来自Illum ina公司和A ffymetrix公司。每张基因分型芯片上包含了成千上万的SNPs检测探针,而且随着检测技术的不断完善,芯片的分型通量还在不断增加,从最初含1万SNPs探针A ffymetric 10 K基因分型芯片到目前包含数十万甚至一百万探针的A ffymetric 500 K,A ffymetric 6.0,Illum ina 300 K,Illum ina 610-quad,Illum ina 1M等高密度分型芯片;还有部分芯片整合了拷贝数变异探针,如Illum ina 370,Illum ina 610-quad,A ffymetric 6.0等,研究者可以同时对人类基因组常见变异SNPs和CNVs进行分析。(https://www.daowen.com)
随着分型技术的不断改进,每个SNP分型的成本显著降低,这使得GWAS广泛应用于各种复杂疾病的研究,使复杂疾病/性状易感基因的研究现状得到彻底改变。
大规模GWAS研究发现了许多与表型相关的重要遗传变异,包括常见疾病的表型、数量性状、社会行为特征(如幸福),甚至基因表达和DNA甲基化水平。这些显著影响性状的遗传变异中有一部分已经指导分子实验室的工作去发掘潜在的治病机理,比如FTO和肥胖、MHC和精神分裂症。
当我们深入研究复杂性状的整个基因构成时,我们将得出一些重要的结论。最初的观察来自最重要的位点,科学家发现这些达到统计阈值的遗传变异只能解释少量表型差异。
早在2007年,就有人认为GWAS数据可用作疾病或复杂性状的遗传预测。当前遗传预测的关键约束是没有足够的大样本来获得足够准确的多基因风险评分。多基因风险评分不适用于单个个体,其主要作用是区分最高和最低风险组。因此,GWAS近年来为临床服务或为火热的“精确药物”提供理论依据还有广阔的发展前景。
GWAS为人们研究复杂疾病打开了大门,将患者全基因组范围内检测到的SNPs与对照组进行比较,找到所有变异等位基因频率,从而避免了像候选基因策略那样需要预先假设致病基因。