5.2.1 遗传标记
人类基因组包含大约30亿个碱基对,其全序列图谱已经绘制完成。但要在如此庞大的序列中确定基因或特定DNA序列的位置并不容易。为了更好地进行基因定位和序列分析,必须对整个人类基因组进行精细的划分。从宏观层面上划分,人类基因组分布于人类的22条常染色体(1—22号)和两条性染色体(X、Y)上。通过细胞遗传学方法可以将每条染色体分为长臂、短臂、区域、条带和亚带。在微观层面上,利用遗传标记对每一条染色体的亚带所包含的几百万个碱基做更细致的划分和标记。遗传标记具备可遗传性和可识别性的基本特征,用它可以定位染色体或染色体中某一节段、某个基因座在家系中传递的遗传特性。生物的任何有差异表型的基因突变均可视为遗传标记。常见的DNA分子遗传标记技术有限制性片段长度多态性(Restriction Fragment Length Polymorphism,RFLP)、随机扩增多态性DNA(Random Amp lified Polymorphism DNA,RAPD)、扩增片段长度多态性(Amp lified Fragment Length Polymorphism,AFLP)[7]、微卫星DNA(M icrosatellite DNA,MSD)、单核苷酸多态性(Single Nucleotide Polymorphisms,SNPs)、拷贝数变异(Copy Number Variations,CNVs)等[9]。遗传标记也在不断的发展之中,其中RFLP属于第一代的遗传标记,MSD属于第二代,SNPs属于第三代,而CNVs是第四代。第四代最近几年才开始应用。遗传病研究常用的遗传分子标记有三种:微卫星、单核苷酸多态性、拷贝数变异。下面对这三类遗传标记予以简要介绍。
(1)微卫星标记
微卫星标记,又称为简短串联重复(Short Tandem Repeats,STRs),指的是以2—4个碱基为单位的串联重复序列[11]。微卫星标记在人类基因组中分布广泛,具有高度多态性的特征,也就是说每个遗传标记的等位基因较多,提供了较大的信息量。人类全基因组的微卫星图谱已经完成,利用微卫星标记,可以对人类全基因组进行大规模扫描,也就是常用的连锁分析方法。
(2)单核苷酸多态性(https://www.daowen.com)
单核苷酸多态性(SNPs)指的是基因组上由单个核苷酸的变异而引起的DNA序列多态性。SNPs是人类可遗传的变异中最常见的一种,在人类基因组中广泛存在,而且数目多、覆盖密度大。人类基因组中SNPs的总量超过1 000万个,平均每300个碱基对至少对应一个SNPs。研究这种多态性分布,可以深入了解个体和群体间基因组差异,所以可以应用于遗传作图、基因组多样性检验、基因的鉴别和定位、建立疾病风险与表型间的关系研究中,从而影响并推动人类进化、种群多样性、复杂疾病的诊断与治疗。
(3)拷贝数变异
拷贝数变异即拷贝数多态性(CNPs)是广泛存在于人类全基因组上的DNA序列结构变异现象。大小通常从kb到Mb范围的DNA片段删除、插入、复制和复合到多位点等导致的拷贝数变化。全基因组水平的研究揭示,人群中广泛存在大片段的拷贝数变异[12]。目前共发现CNVs约57 829个,至少占到基因组的12%,已成为基因组多态性的又一重要来源。CNVs包含了成百上千的基因、疾病位点、功能性因子和片段重复,相对于SNPs含有更多的核苷信息量,在遗传多态性和进化上起着更加重要的作用。已经发现一些CNVs使得某些疾病的易感性增高,如A IDs[13]、免疫介导的肾小球肾炎[14]和节段性回肠炎[15]。