5.2.3 关联分析
关联分析(Association Analysis),又称为连锁不平衡分析(Linkage Disequilibrium,LD),是指选择的多态性遗传标记在无亲缘关系的病例组和正常的对照组中的频率是否存在明显差异现象,从而获得该遗传标记和疾病基因关联的相对危险程度。关联分析相对于连锁分析更容易找到中效或微效致病基因,因此更适合多种基因共同致病的复杂疾病研究。
关联分析又可细分为两种:(1)基于人群的病例对照研究(Case-Control Study)。(2)基于核心家系(Nuclear Fam ily)的研究,如常用的传递不平衡检验(Transmission Disequilibrium Test,TDT)[17]。病例对照研究通过分析预先选定的SNPs在随机选取的一定数量的病例及正常对照样本中的频率差异,然后利用统计学方法分析这种差异的显著性。如果统计差异显著,则该遗传标记位点与所研究的疾病关联,那么其所代表的位点(连锁不平衡的位点)可能与该疾病相关。如果统计结果差异不显著,则表明在选择研究的样本组中,该位点及其所代表的位点与该疾病无关联性。传递不平衡检验是通过检验核心家系(包括先证者、生物学父母及同胞)中双亲的等位基因的在先证者及其同胞中传递的情况,来确定该位点与疾病的关系。如果传递是随机的,那么该位点可能与疾病无关;如果传递不随机,该位点就可能与疾病相关。
关联分析中连锁不平衡程度常用D′或者r2值来衡量。这两个值的由来如下:假如同一染色体上两个距离接近的等位基因分别为A,a和B,b,其对应的频率分别为P(A),P(a)和P(B),P(b)。如随机组合的话,会出现4种可能存在的单倍型AB,Ab,aB,ab。那么AB在同一条染色体上出现的频率就是P(AB)=P(A)×P(B),但是当这两个位点并不是完全随机分布时,其频率P(AB)=P(A)×P(B)+D中,D指的就是连锁不平衡的程度。
令D=P(AB)-P(A)×P(B),
则r2=D2/P(A)×P(B)×P(a)×P(b);(https://www.daowen.com)
D′=|D|/|D|max
D′和r2大小介于0和1之间,一般情况是D′>0.8或r2>0.3,LD就较大。
此外,做关联分析检验时所研究的等位基因、基因型或单倍型在病例组和正常对照组的分布频率的差异要用Fisher精确检验或用Pearson'sχ2计算出零假设成立的前提下的数据的概率(P value),若P<0.05,则所研究的等位基因、基因型或单倍型与疾病状态存在关联,p值是关联可能性数值的度量。另一个统计量OR(比数比)可以精确估计位点对疾病的危险程度。如果OR值的对数近似呈现正态分布,OR值的置信区间就可以推算出来,常用数值为95% CI。OR是否有意义还要看P值,一般95%CI,OR值=1,表示该等位基因对疾病的发生不起作用,该等位基因和疾病没有关联;OR值>1,表示该等位基因和疾病存在正关联的趋势,是一个危险因素;OR值<1,该等位基因和疾病存在负关联的趋势,是一个保护因素。复杂疾病易感等位基因的OR值通常较低,一般处于1.1~1.5之间[17]。
连锁不平衡分析认为,两个位点连锁越紧密,在重组过程中它们的连锁被打破的概率越低,它们之间连锁不平衡程度也越高。但是除了重组之外,还有其他因素参与其中,诸如突变、选择压力、遗传漂变等因素,都会对连锁不平衡程度产生影响。同时连锁不平衡之所以能用于关联研究是基于一个重要假说:人群中等位基因频率大于1%的常见变异(Common Variant)是引起常见疾病的致病缘由,即“常见变异导致常见疾病的假说”[17]。正是基于连锁不平衡的存在和常见变异导致常见疾病的假说,关联分析研究已经成为研究复杂疾病遗传机制的重要手段与工具。然而,近几年对精神分裂症的拷贝数变异研究发现常见疾病同样也受罕见变异的影响[17]。