6.2.7 抑郁症的全基因组关联分析
如上所述,已有>20个基因被证实与抑郁症发病有关,并通过荟萃分析的验证。在大多数情况下,这些关联证实的基因与抑郁症发生的一般理论没有直接联系。关联研究开始转向为使用全基因组关联分析的方法,而没有任何关于抑郁遗传风险因素的建议。
在GWAS的第一阶段,对患有多次抑郁事件、严重病症或临床发病年龄的成员的家庭进行了分析,特别关注罕见单基因型抑郁症患者。这些研究的结果总结在表6-5中。这些研究报道了与较大的基因组区域(甚至与染色体一样长)的关联,且候选基因的鉴定似乎是临时的。这种鉴定主要基于早先在这些基因组区域中定位的抑郁症候选基因。
表6-5 与不同形式的抑郁症相关的易感性基因座
在过去十年中,越来越多的研究者使用GWAS来识别控制复杂性状的基因座。GWAS可以在具有特定感兴趣特征的人群中识别分布在整个基因组上的多达数十万至数百万个SNPs。基因型—表型关联的分析可以将在基因组的某个特定区域中的等位基因变异与所研究的性状之间建立联系。GWAS与使用病例对照方法的候选基因研究之间的主要差异在于没有初步假设来解释基因的多态性变异对该病的病理学的发展做出的贡献。然而,对于获得统计学显著结果的研究,其算法需要患者和健康人的非常大的样本。在非常大的样本中实现临床同质性是非常困难的,特别是在研究精神疾病时,因为总是有一个主观因素影响相关国际分类诊断的准确性,几乎没有评估患者病情的工具方法。
已有许多研究探究与重度抑郁症相关的基因座或抑郁症的个体症状。结果总结在表6-6中。该表主要集中分析那些主要抑郁症作为疾病而不是内表型(如临床发病年龄、特定症状的严重程度、患者对治疗的反应)的风险的研究。
表6-6 重度抑郁症(MDDs)和复发性抑郁症(RDDs)的全基因组关联研究
(续表)
(续表)
Sullivan等人[253]报道了第一个大样本(1 738名DD患者,1 802名对照)的GWAS。在这项研究中,没有找到任何与抑郁症相关联的达到全基因组显著水平的SNP,仅发现rs2715148具有最大显著性(P=7.7×10-7)。此外,在PCLO基因附近的基因组区域中,找到了更多的具有相对低显著性水平的SNP与抑郁症相关(P=10-5-10-6),它们位于PCLO所在的167 kb区域[253]。定位于突触前活性区的细胞质基质中的PCLO蛋白可能在脑单胺能神经传递中起重要作用。Hek等人[246]证实了该区域在抑郁症发作中的可能作用。在荷兰的一项基于人群的研究中显示了PCLO和抑郁症中rs2522833之间的关联[246]。A ragam等人[244]发现女性PCLO中rs2715148(P=5.64×10-7)与抑郁症发生具有统计学意义。该研究发现LGSN中另一个与男性抑郁症发生相关的SNP(rs9352774,P=2.26×10-4)。该基因在人晶状体中活跃地表达,编码与GS-1相关的蛋白质,并且在较小程度上编码GS-Ⅱ谷氨酰胺合成酶。该蛋白质可能在视网膜和神经系统中的谷氨酸交换中起作用。
在Rietschel等人[240]的GWAS中发现了谷氨酸在抑郁症中的作用。他们发现抑郁症和位于HOMER1的指定调节区的rs7713917之间存在关联(P=5.87×10-5)。HOMER1通过与代谢型谷氨酸受体mGluR1和mG luR5的相互作用编码参与谷氨酸能过程的蛋白质。
我们重申,在大多数GWAS中发现的关联并未达到全基因组的显著水平,这主要是因为罹患抑郁症的复杂性状的遗传结构。全基因组重要性水平的调整非常严格,我们认为还应考虑概率值接近全基因组阈值水平的SNP标记。
也有一些研究发现的位点已达到全基因组显著水平,如Koh li等人[243]首次报道了SLC6A15(溶质载体家族6中性氨基酸转运蛋白成员15)中的rs1545843与抑郁症之间存在关联的隐性模型,该多态性增加了患抑郁症的风险。在癫痫患者的海马中该基因编码中性氨基酸转运蛋白,并且该基因显示不同的rs1545843等位基因,具有不同的SLC6A15表达水平。作者提供了附加的证据来支持这种关联,并表明风险等位基因的存在与海马中较低的SLC6A15表达、较小的海马体积和体内神经元完整性相关。在具有升高的慢性应激易感性的小鼠的海马中也观察到Slc6a15有较低频率的表达。
Kohli等人[243]提供了大量数据支持SLC6A15和抑郁症之间的关联。然而,随后的GWAS未公开与该基因的关联。在GW AS中获得的数据通常是不可再现的,两个GWAS中只发现有一个与抑郁症相关共有基因——PCLO。(https://www.daowen.com)
精神病学基因组学联盟(PGC)对GWAS数据进行了荟萃分析。与传统的荟萃分析不同,PGS研究汇集并检查了来自不同研究中心的患者的个体基因型和表型数据。汇集了所检查的每个成分分析的统计数据。PGS公布了其对来自抑郁症患者的9 240个样本和来自9个欧洲人群对照组的9 519个样本全基因组比较分析的结果[254]。然而,在PGS分析中,早期研究中鉴定的SNP均未达到全基因组显著水平。具有最显著值的SNP是rs11579964(P=1.0×10-7),定位于CNIH4,NVL和WDR26基因附近;其次是rs7647854(P=6.5×10-7),其定位于C3orf70和EHHADH附近。随后使用独立样本(6 783名患有重度抑郁的患者和50 695名对照)进行的复制性研究,却未证实所提及的关联。
因此,在全基因组水平上,尚未发现一致性的与抑郁症相关的基因座的研究结果。独立样本中显示的关联也未被重复验证。缺乏显著性和可重复性,可能反映了GWAS方法的特定特征,该方法主要关注在关联分析中具有高次要等位基因频率(>5%)的多态性位点。这些高频率的多态性变异位点本身可能不是病原学上所必需的,但可能存在与抑郁症发病机制相关的罕见基因变异的联系。这些罕见的变种可能是针对不同人群的特定变种。因此可以在一个样品中发现疾病与频繁多态性位点之间的任何关联,并且可以反映该多态性位点与该样品中罕见的、病原性显著变异的不平衡连锁。然而,在另一个样本中可能缺少病原学上重要的位点,因此不会发现频繁多态性与抑郁症发生的关联。此外,据报道罕见基因组变异(频率<1%)的重要作用与其他精神障碍有关,如精神分裂症和孤独症[255,256]。
为了克服这些问题,研究者选用的研究手段从使用芯片的多态性DNA标记分析到低覆盖度DNA测序的转变,这种转变为研究鉴定抑郁症相关遗传变异提供新的方向。第一项此类研究的是在CONVERGE项目[257]内进行的,包括基因组测序。该组中有5 000名女性患有忧郁症,这被认为是一种非常严重的抑郁症。该研究发现两个位点具有10-8显著性水平的关联:一个位于SIRT1的5′侧(SNP rs12415800),另 一 个 位 于LHPP内 含 子(SNP rs35936514)内。这种关联在一个独立的患有忧郁症的中国女性样本中得到证实。两个位点的显著值分别为2.53×10-10(SIRT1的)和6.45×10-12(LHPP的)。对该项目数据的进一步分析表明,常见的SNP占抑郁症风险的20%~30%,这表明抑郁症的遗传力均匀分布在所有染色体上,在编码中均优先定位于抑郁症相关的SNP和基因的3′-非翻译区。抑郁症患者显示基因编码区域中独特突变的频率增加主要存在于神经组织中活跃表达的基因中[258]。
值得关注的是,这项研究包括一个特定的种族群体(汉族人),这种群体非常均匀,只有女性具有较高的遗传度,具有严重的抑郁症形式。这种设计包括更严格的方法、样本和考虑因素,如患者的性别、临床抑郁症变异、临床发病年龄及其他可能影响患病风险及其进展的因素。但是,这些因素可能对抑郁症发展的风险没有影响。例如,临床发病年龄最近显示不影响中国CONVERGE样本中的关联分析结果[259]。
另一项研究还发现种族很重要[260]。该研究综合分析了包括中国调查结果和PGC在不同欧洲人群中进行的研究结果。这些研究发现,一些SNP影响了所提到的两个种族的抑郁症发病风险,但也同时检测到每组特定存在于每个种族的SNP。
Power等人[247]试图将环境因素纳入GWAS中。此研究采用倾向评分匹配的方法,该方法探究包括病例组、对照组及引发压力的因素。在对抑郁症患者和暴露于类似应激源的健康对照进行分析时,能够降低样本在应激因子方面的异质性。
抑郁症的遗传结构似乎极其复杂并且涉及大量基因座,这会出现各种表型效应并显示复杂的相互作用。对遗传结构的研究表明,需要从单个SNP的分析过渡到SNP组的分析。最后,还应包括用于精神分裂症的遗传学研究多基因风险评分[261]。
为了解决类似的问题,目前研究者主要采用联合来自众多SNP的信号和随后的信号传导及代谢途径的功能分析产生的基因网络的策略。该方法提供了来自多个基因座的弱信号的比较分析。Song等人的研究[262]是这种分析的一个很好的例子。基于来自欧洲队列的GWAS样本,作者对这些SNP的抑郁症连锁SNP和基因进行了搜索和分析,以发现将这些基因相互连接的信号通路[262]。笔者发现五个结果信号路径在抑郁症发病机理中起作用,其中三个声称以某种方式与基因表达的负调节相关(GO:0016481,GO:0045934,GO:0010629),并且与一些抑郁的SNP相关:如ATF7 IP中的rs3213764,HOXA7中的rs2301721,LRRFIP1中的rs6720481,NRIP1中的rs2229742。
Okbay等人[249]和Hyde等人[263]提出了另一种取样方法。为了诊断抑郁症,他们编制了一份调查问卷,由受访者填写。抑郁症是根据受访者对调查问卷的答案进行诊断的,没有精神科医生的临床诊断。尽管有人可能会对诊断的准确性提出质疑,但问卷中包含了关于各种表型特征的问题,受访者无法将其与任何诊断相关联。来自生物库或大规模基因分型服务的数据使他们能够显著增加样本量。例如,Hyde等人的研究[263]包括了>450 000个人,并且他们的问卷数据分析使他们能够诊断大约120 000名患有抑郁症的参与者。这种数量的样本比PGC研究或CONVERGE项目中包含的样本大一个数量级,这有助于最大限度地减少抑郁症诊断错误而引起的问题。研究者设法在15个基因座中鉴定17个SNP标记,其显著水平>5×10-8,这反映了所分析样本的数量。虽然他们都分析了欧洲血统的样本,但在PGC研究中检测到的DNA标记与抑郁症相关的标记不同。因此,在GWAS中获得的结果的再现性问题仍有待解决。
一种可能解决这个问题的方法是对GWAS研究进行荟萃分析,该分析由W ray等人[264]进行。这项荟萃分析确定了44个独立的位点具有统计学意义(P<5×10-8)。在这44个基因座中,30个是新的,14个在先前的重度抑郁或普通抑郁症状研究中被发现,还有6个位点为精神分裂症共有位点。因此,一方面,荟萃分析中样本量的增加可以将先前用GWAS获得的结果与先前描述的和重度抑郁相关的基因座的进行再次验证。另一方面,荟萃分析通过增加样本量来增加研究的精准性,从而可以识别与重度抑郁症相关的新基因座。
笔者提出了几种计算遗传风险评分(GRS)的方法:简单计数遗传风险评分(SC-GRS)、优势比加权遗传风险评分(OR-GRS)、直接逻辑回归遗传风险评分(DL-GRS)、多基因遗传风险评分(PGGRS)和解释方差加权遗传风险评分(EV-GRS)。目前,有人最广泛使用的方法是多基因风险评分(PGRS)[265]。这种方法已用于获取遗传效应的证据,即使没有显著的单一标记物来建立相关疾病的共同遗传基础,并构建风险预测模型[266]。目前,有人提出了GWAS数据统计分析的替代方法,其中分析不是单个DNA标记,而是它们的组合。最近,有几篇关于重度抑郁症和其他精神疾病的研究[267-269]的相关论文发表。这证明了使用PGRS评估几种基因多态变异位点对重度抑郁症内表型形成的累积贡献的可能性。Whalley等人[268]使用PGRS将重度抑郁症分为两种亚型,其中一种接近精神分裂症。