8.1.4 统计分析

8.1.4  统计分析

所有位点均采用TaqMan基因分型技术,在结合Fluidigm公司96.96微流体芯片的EP1高通量基因分析系统上完成基因分型。所有位点的call rate值均大于96.5%,见表2-5。除特别指明分析Weinberg软件之外,以下所有分析均采用上海交通大学Bio-X研究院自主开发的SHEsis分析平台(http://analysis2.bio-x.cn/myAnalysis.php)分析[31,32]。SHEsis分析平台是一个整合了众多遗传指标分析功能,能够进行多项统计指标分析,方便快捷和容易入门,很适合关联研究的数据分析平台。

(1)Hardy-Weinberg平衡检测

用SHEsis分析平台对所有位点进行哈迪—温伯格连锁不平衡分析,算出各个位点的P值。除了rs10774037在正常对照中不符合哈迪—温伯格平衡,其余所有位点在正常对照、精神分裂病例和重度抑郁症病例中的分型结果均符合哈迪—温伯格平衡。详细信息见表8-7、8-8。

(2)卡方独立性检验

利用SHEsis分析平台,分析所有位点在正常对照、精神分裂病例和重度抑郁症病例中等位基因频率、基因型频率和单倍型频率。所有检验均是双侧检验,显著性检验水平设置为0.05。

(3)比数比

比数比(Odds Ratio,OR)是用来衡量所研究的基因与疾病的关联程度(可以是正向关联,也可以是负向关联),或是用来衡量所研究基因对疾病作用强度的估计值。其公式如下:

OR=(a/b)/(c/d)=ad/bc(https://www.daowen.com)

其中,a和b为一对等位基因在病例组的数目,c和d为等位基因在对照组中的数目。

若OR>1,则意味着该基因与疾病成正向关联,可能是一个致病风险等位基因;若OR<1,则意味着该基因与疾病成负向关联,是一个保护性的等位基因。我们同样采用SHEsis分析平台来分析这项指标。

(4)置信区间

置信区间(Con fidence Interval,CI)是用来估计参数值的范围,表示一定程度的信心,一般为95%。同样,用SHEsis平台来计算。

(5)D′值和r2值的估计

D′值和r2值均是用来度量多态性位点之间连锁不平衡程度的值,用来衡量观察到的单倍型频率与平衡状态下期望频率的偏差。D′值和r2值是介于0~1之间的数值,数值越大表明两位点之间的连锁不平衡程度越高。D′和r2值为零时,连锁完全平衡;D′和r2值为1时,连锁完全不平衡,一般认为,D′>0.8或r2>0.3意味着较强的连锁不平衡。关于D′值和r2值的公式,见第1章文献综述中精神疾病的遗传学研究方法一节。此处必须指出的是,D′值的大小严格依赖样本数量的多少。如样本量大,D′值代表的实际含义很容易被“夸大”,特别在等位基因的频率过低的情况下。因此,连锁不平衡程度很低的两个位点可能会拥有较高D′值。D′值和r2值的评估也是在SHEsis平台上进行的。

表8-7 所有位点在精神分裂症病例与正常对照中的callrate值与HW E 检验P值

图示

① 因SNPrs10774037在对照样本中不符合哈迪—温伯格定律,在后继分析中将不对其进行分析。

表8-8 所有位点在重度抑郁症病例与正常对照中的callrate值与HWE检验P值

图示

(6)单倍型频率的估计

单个遗传标记进行关联分析的统计效力较小,而多个彼此间连锁不平衡程度较高的遗传标记组成的单倍型则能提供更多的信息量,能增大统计的效力,比单位点更可靠地反映出连锁不平衡的程度。单倍型频率的估计也是SHEsis平台完成分析的。

(7)人群层化分析

关联研究最主要的局限在于其结果容易受到混杂因素的干扰,群体的遗传分层现象就是其中之一。在病例对照关联研究中,如果某遗传标记的等位频率在病例和对照组间存在显著差异,但这个遗传标记并不与疾病表型相关,这种情况下样本就存在群体分层现象。群体分层可能导致遗传关联分析结果出现偏倚,产生假阳性或假阴性结果。这也是很多关联研究结果难以在不同人群中得到重复验证的原因所在。因此,在进行病例对照的关联研究时,尽可能排除群体分层的干扰显得尤为重要。群体分层往往是由于遗传背景不一的亚人群混合所致,其产生机制复杂,可能与各亚人群祖先的迁移模式、婚配习惯、生殖强弱及基因组的随机突变等因素有关。排除群体分层干扰的常用手段是加大样本量并尽可能选择一个遗传上相对均质的群体,如出生地、年龄结构、种族、性别比例相同、人口流动性小的隔离群体。即便如此,仍不能彻底排除隐藏分层的干扰。

为了避免因人群层化而造成的假阳性的关联结果,我们使用STRUCTURE软件(Version 2.3.4,http://pritch.bsd.uchicago.edu/structure.htm l)[33-36],进行人群层化分析。我们所做的人群层化分析共用了79个SNP的基因分型数据,按照种族分成三块。本次研究共有79个SNP位点在1 235个彼此独立的精神分裂症病例、1 045个彼此独立的重型抑郁症病例和1 235个正常对照中做了分型。我们把这些位点的分型数据加上这些位点在522个HapMap的数据(174 CEU,209 YRI,139 CHB)(HapMap public release 28 at http://hapmap.ncbi.nlm.nih.gov/cgi-perl/gbrowse/Hapmap28_B36/)[37]一起来分析,并且从K=2到K=10之间进行运算。软件在分析时,假定有K种人口(K值表示所测试的样本潜在的种类数目),利用所有的分型数据来分析人群层化,具体见图8-10。考虑到移民和地域性遗传隔离和所有两种病例的样本均来自相同的人群,我们使用混合模型和独立的等位基因频率模型,参数length of burnin period设为10 000,Number of MCMC Reps after burnin也设为10 000。

图示

图8-10 当K从2到7时的人群层化分析图

(8)精神分裂症与重度抑郁症的联合分析

本书的综述部分曾梳理过精神疾病之间在临床症状、表型上和遗传易感性方面的交叉与共享。支持CV/MD假说的证据越来越多,有些重要的研究已经颠覆了人们对精神疾病的传统认识。如果将精神分裂症和重度抑郁症视为一种混合疾病,将其统计数据作为一个整体病例与正常对照组展开对比分析,是否能发现更有价值的信息?这一想法驱使我们做了一个简单的联合分析。分析这10个位点在2 280个病例(1 235例精神分裂症患者病例和1 045重度抑郁症病例)与1 235例正常对照的关联情况。