20.2 样本含量确定

更新于 2026年10月10日 版权声明
20.2 样本含量确定

在设计一项生殖健康研究时首先提出一个问题是“需招收多少人参加研究?”。为回答这个问题,研究者首先必须回答“希望通过研究达到什么目的?”的问题。从本质上讲,研究必须建立在假设检验基础上。样本含量是通过定量描述所作假设检验的不同参数间联系的统计学方法来确定的。研究者必须提供公式中要用到的参数。

20.2.1 样本含量计算所需数据

先看一个研究例子,已知吸烟男性的精液量正常率(80%)小于不吸烟者(90%),现设计一个戒烟的干预项目,需估计该项目所需的样本量。计算前瞻性干预研究的样本含量需要一些数据,这些数据是:

图示

据此就可计算出临床试验所需样本含量,所有研究设计都需要类似的数据。这些数据有什么意义,达到什么目的,请看例20.1。

例20.1 计算前瞻性干预研究样本含量所需的数据。

根据以往调查结果显示,吸烟者精液量正常(≥2ml)率为80%(p0),而不吸烟者精液量正常率为90%(π)以上。现计划设计一项开展戒烟的健康教育项目,需计算样本含量。在研究设计时,要考虑以下几个问题才能确定适当的样本含量。

1)研究的主要目的是什么(假设的陈述)?研究目的是通过戒烟健康教育(时间半年)达到戒烟后提高精液量正常率。无效假设:戒烟与否的两组男性精液量正常率没有差别。

2)主要测量结果是什么?该健康教育项目6个月后男性精液量的正常(≥2ml)率。

吸烟组的精液量正常率(用p0表示)多少?根据以往调查结果,吸烟者精液量正常率为80%(p0=0.80),无效假设为6个月后吸烟组精液量的正常率不变(80%),即精液量异常率为20%(即1~80%)。

3)戒烟组的精液量正常率提高(α)多少后可被检验出?以及统计把握度是多大?

预期戒烟组戒烟6个月后正常率提高。但若戒烟是无效的话,或戒烟组的正常率也可能低于吸烟组,即戒烟组精液量正常率有可能反而下降。希望两组正常率上升或下降相差达到10%(d),就可以在统计上检验出有差异。也就是以吸烟组期望正常率80%为基础,戒烟组的正常率在小到70%或大至90%时,就能在统计上检验出它们的差别。此外,在正常率相差达到10%(d)时,检验出有差异的机会(把握度1-β)是0.90(或90%)。

4)如果两组的正常率实际没有差别,但统计上却得到有差别的结论的概率(α)有多大?

在正常率间实际无差别而得到有差别统计结论时,所担当的风险概率(α)最大是0.05,即5%。

5)被纳入研究的男子在研究结束前因各种原因(非研究结局原因)退出研究的比例(f)是多少?(https://www.daowen.com)

因为正常率是研究结果指标,所以由各种原因退出研究都被视为戒烟的停止。

当比较一个干预和一个未干预(对照),暴露(干预)个体和非暴露(非干预)个体,或病例与对照时,研究者可能只对检验单侧的差异感兴趣。例如想判断干预是否优于非干预(暴露)组,是否增加发生某种令人感兴趣的结局,或病例组暴露于危险因素的比例大于对照组,这些例子都是单侧比较。如假设戒烟只会使精液量正常率上升,则为单侧检验。而在另一些研究中,研究者可能不管方向,只对两组在某一水平是否有差别感兴趣,这类比较被称作双侧比较。例20.1是双侧比较,研究者想确定戒烟组的正常率是否高于或低于服用吸烟组。对于这类比较,希望通过Z统计量来计算样本含量。表20.2列出了单侧和双侧比较的统Z计量。

表20.2 不同水平计算样本含量所需的Zα

图示

20.2.2 调整样本含量以减少无应答的影响

如果资料直接从研究对象中收集,在估计样本含量时必须考虑无应答的问题。无应答可能有很多原因,包括拒绝参加或中断参加研究,无法找到研究对象的下落以及样本记录单上信息有误。由样本含量计算公式所得的样本含量是在研究中必须得到的具有完整资料的研究对象数,而不是被选中的人数。为了满足可信度(1-α)和研究所定的允许误差值,研究者应该估计可能发生的无应答水平,并据此扩大估计的样本含量。

因无应答而需调整样本含量,即样本含量需乘以一个因子(q):

图示

20.2.3 确定样本含量时需要考虑的其他问题

导出估计样本含量公式的统计理论包含了几个假定。如果实际情况不能满足这些假定,计算出的样本含量可能无效。样本含量的确定主要受两个假定的影响:①样本所来自的总体无限大;②样本是通过单纯随机抽样获得的。实际上,这两个假定常被违反。但是,在只有一个或两个假定都不满足的情况下,可以通过调整来校正研究中的样本含量。

尽管样本来自无限大总体的假定永远也不可能是真的,但相对于样本来说如果总体很大,可以用标准样本含量公式准确地计算出所要求的样本含量。如果总体不够大,必须应用无限总体校正(f pc)公式。作为一般原则,只有当样本超过总体的5%~10%时才需要应用f pc。f pc所产生的校正样本含量n′,计算如下:

图示

如果总体大小不能精确知道,对总体含量的估计应该足够了。应用f pc将减少样本估计量。当需要用f pc时却没有考虑它,研究者很可能用了较大的样本,而实际上用较小样本可达到期望的准确度。f pc在描述性研究和在病例-对照研究设计中对照组含量计算时常用的。

样本含量的计算公式是以单纯随机抽样的假设推导出来的。因为出于实际考虑,如费用、时间和进行研究所需的资源等的限制,抽取一个单纯随机化的样本几乎是不可能的。第十八章描述了各种类型的抽样设计并且讨论了应用条件。如果一项研究所用的抽样设计不是单纯随机抽样,在计算样本含量时就应该考虑用一个特殊设计,但没有简单的公式可以计算设计效应以用来校正。

↑上一章 ↓下一章
关注公众号获取验证码
复制内容需要验证码(7.99元/天)