20.3 不同研究类型的样本含量估计
20.3.1 描述性研究
在描述性研究(descriptive study)中,研究者对总体中具有或产生与健康有关的某种特殊结局或特征的比例感兴趣,直接对整个总体进行评价往往不可能,因此,必须从总体中抽取样本。如果应用统计原则来构建样本,可以用统计理论根据样本中某种结局的发生率或归因比来推断总体具有同样结果的情况。
在描述性研究中,没有检验假设。唯一影响样本含量大小的因素是所希望达到的准确度。在这种情况下,应根据可信区间概念来确定样本含量。
只要从研究样本中得到一个率或一个均数及其标准差,就可以算出总体率(均数)的可信区间。研究者必须确定可信区间的可信度。可信度是可信区间包含真实总体率(均数)的概率(可能性)。可信度越高,可信区间越宽。α代表发生Ⅰ类错误,即可信区间中不包含真实的总体率/总体均数的概率。只要这些确定了,就可以运用统计方法,在可信区间概念的基础上来计算合适的样本量。可信度越高,样本含量越大。
率的样本含量的计算需要以下数据:
d——差距(或允许误差值),为估计率与总体率的差值(如在0.05以内);
1-α——在允许误差值(d)范围内得到估计率的可信度(1-α,以小数表示,如0.95);
p——率的最佳估计值。如果没有关于p的资料,则取p=0.5作为保守估计。用这些数据,描述性研究的样本含量计算公式如下:

例20.2 据报道,曾有人进行一个小样本调查,某地精子前向运动率异常比例为30%(p=0.3),现欲计算对该地男子的精子前向运动率异常比例进行一个抽样调查,α取0.05,误差不大于3%(d),调查所需的估计样本大小。
查表Z0.05=1.96,
n=0.30×(1-0.30)×(1.96/0.03)2=897(人)。
均数的样本含量计算需要以下数据:

例20.3 据报道,已进行过一小样本调查,男性精子密度为(珚x)63×106/ml,标准差(s)为32×106/ml。现计划进行一项全国性男性精子密度调查,以省为单位,α取0.05,要求误差不超过5×106/ml(d),计算每一个省的样本含量。
α取0.05,Z0.05=1.96,则
n=(1.96×32/5)2=158(人)(每个省)。
20.3.2 定群研究
在定群研究(cohort study)中,比较暴露于某潜在的有害于健康(或有利于健康)的因素和非暴露于该因素的人群中产生某一特定结局者所占的比例。这两个研究组被称为暴露组和非暴露组。
定群研究的样本含量计算公式与随机化临床试验的公式相似,需要以下数据:
p0——非暴露组有可能出现某一结局的比例。
p1——暴露组可能出现同一结局的比例。该比例常常相对于p0来设定,并且研究者希望检验出p1与p0不同。
α——显著性水平,或Ⅰ型错误的概率。
β——Ⅱ型错误的概率,1-β—把握度
f——研究对象因非研究结局而退出研究的预期比例,q=1/(1-f)。
定群研究中暴露组和非暴露组样本含量的计算公式为:

表20.3 把握度(1-β)或β不同时计算样本含量所需的Zβ

例20.4 据以往调查,流动人口18~22岁未婚性活跃青少年避孕套使用率为10%,现欲开展一项半年期健康干预项目,希望该人群的避孕套使用率提到20%。确定α为0.05,并认为干预不可能致避孕套使用率下降,故应用单侧检验;把握度1-β为0.90,即β为0.10,预期失访率<10%。请予计算样本含量大小。

由上公式计算可知,该健康干预项目干预组和不干预组必须各招收18~22岁合格对象至少244名。
20.3.3 随机化临床试验
在随机化临床试验(randomized clinical trial)中,比较A治疗组B治疗组发生某个特定结局的比例。两种治疗分别被当做新疗法和对照疗法,对照治疗也被叫做标准治疗或安慰剂治疗,每一组样本含量的估计需要以下数据:
p0——对照组发生某种结局预期的率。
p1——治疗组发生某种结局预期的率。这个率常常根据p0来设定,研究者希望检出p1与p0不同。(https://www.daowen.com)
α——显著性水平,即Ⅰ型错误的概率。
β——Ⅱ型错误的概率,1-β——把握度。
f——对象因其他各种原因(不包括发生预期结局)停止参与研究的比例。
f用来扩大样本含量以弥补研究结束前离开研究的个体。f的水平通常可从以前类似的治疗经验和类似研究中估计出来。在发生无应答或参与研究者中途退出时的样本含量校正因子为q=1/(1-f)。
式(20.4)确定了随机化临床试验每个治疗组的样本含量,该公式与定群研究样本量计算公式相同。

例20.5 一般使用的杀精剂一年避孕失败率是16%(每100个使用杀精剂的妇女在一年中有16人怀孕)。研究者欲比较新杀精剂的避孕失败率,并确定新杀精剂避孕失败率能否减少一半,即年避孕失败率低于8%。

![]()
上例的研究各组(新杀精剂组和一般新杀精剂组)需各招收315名对象,才可能检出从失败率是16%下降到8%的差别。

因而若设计一项戒烟健康教育,戒烟6个月后精液量正常率是否可以从80%上升到90%,每组(吸烟组和戒烟组)需要至少297例。
20.3.4 病例-对照研究
与定群研究一样,病例-对照研究(case-control study)的最终目的是用来确定暴露于一个有害健康的因素是否引起某种结局。与定群研究不同的是,在病例-对照研究中,所比较的是有某种结局(病例)和无该结局者(对照)的过去暴露史。
病例-对照研究的样本含量计算公式类似于随机化临床试验和定群研究。为了用公式对样本公式作出估计,需要两个数据:病例中有暴露史的比例(p1)和对照中有暴露史的比例(p0)。研究者应该知道对照组的暴露比例,因为对照常被认为代表总体。两个比例是有联系的;假定可以得到p0和比值比(OR)的估计值,p1的估计值就可以得到。
式(20.7)估计了病例组有暴露史的比例。

OR为发生某一特定结局者中有暴露史的比例除以未发生结局者有暴露史的比例。用于统计检验的比值由研究者确定。
根据p0和OR估计出p1以后,还需要以下数据:
α——显著性水平,即Ⅰ型错误的概率。
β——Ⅱ型错误的概率,1-β—把握度。
计算病例组和对照组样本含量的公式:

例20.6 对照组是在所选医院接受手术或医疗服务的18~44岁未孕妇女。研究者估计对照组约5%(p0)的人在上一次月经周期正在使用宫内节育器(IUD)。病例组是同一医院内18~44岁诊断为异位妊娠的妇女。研究者希望检验出在宫内节育器使用中妇女的异位妊娠率高于未使用者。如果两组异位妊娠率的差别存在,IUD应用者的异位妊娠率是非IUD使用者的两倍(OR)。用式20.7估计病例组暴露率:
p0=0.05,对照组使用宫内节育器比例的估计值。
OR=2(研究者希望检验出在宫内节育器使用者异位妊娠率是未使用者的两倍)。

在例20.6中,研究者假定对照组中的5%在上一次月经期中使用了宫内节育器。调查员希望在把握度为0.95时检验出使用宫内节育器者中异位妊娠率是未使用者两倍时的差别。显著性水平是0.05。在使用式(20.8)计算样本含量前,研究者必须用式(20.7)估计出p1。计算结果显示研究者必须收集724个病例和724个对照。
例20.7 两组样本含量不等的病例对照研究平衡设计是一个十分重要的问题,特别在病例-对照研究中。通常为了优化研究中参与者的总数量,用1∶1的比例收集病例组和对照组,称之为平衡设计。有时病例组和对照组却无法得到相同的样本含量。如果研究的结局是一种偶发现象,可能不容易收集大量的病例。通常情况下,更多的人们符合对照,而不符合病例的要求。
上述所给式(20.8)假定两组样本含量相等。对公式稍加修改可以计算研究者想要的对照组是病例组的r倍时所需的样本含量和把握度。为了计算对照组是病例组的r倍时的样本含量,必须用下面的因子(r+1)(2×r)修改式(20.8):

在例20.6中,研究者假定异位妊娠发生率较低,因而决定按照对照:病例为3∶1收集样本。故例20.6中的p值不再是p0和p1的简单均值,而是它们的加权平均值。计算出样本含量大小(n)是病例组样本含量。而对照组样本含量是r×n。注意,当r=1时,就简化为1∶1的病例-对照设计。

对照组为413×3=1 239人。
则如所要求的病例组为413,对照组为3×413=1 239(总样本含量是1 239+413= 1 652)。而如用平衡设计所需要的样本含量是1 448(724个对照,参考例20.6和例20.9)。