19.2 计数资料和等级资料的数据分析
计数资料(enumeration data),又称定性资料(qualitative data)或无序分类变量资料(unordered categorical data),为将观察单位按照某种属性或类别分组后计数,即分组汇总各组观察单位后而得到的资料;其变量值是定性的,表现为互不相容的属性和类别,分为二分类资料(如是否治愈)和多分类资料(如血型)。等级资料(ranked data),又称为半定量资料(semi-quantitative data)或有序分类变量(ordered categorical variable)资料,为将观察单位按照某种属性的不同程度分成等级后分组计数,分类汇总各组观察单位后得到的资料;其变量值具有半定量性质,表现为等级大小或属性程度,如药物疗效(治愈、显效、好转、无效)。
19.2.1 单个样本率的检验
(1)概念:单个样本率的检验即对一个随机抽取的样本率(p)与一个已知的总体率(π0)进行比较,比较的目的是检验该样本所代表的总体的未知总体率π与已知的总体率π0是否不同。
(2)公式:u检验公式

(3)实例:例19.7某医院以往多年经验表明,男性少精症所致不孕症的治疗有效率24%(π0)。现在引进一种新型药物,治疗男性因少精症而引起不孕症250例(n),有效42例(n+),问新型药物的有效率是否与以往的有效率(24%)不同?
(4)分析:该例为单样本率p与总体率π0的检验。
(5)步骤
1)建立假设,确定检验水准。
H0:π=π0(本例π0=0.24)。
Ha:π≠π0(双侧检验)。
α=0.05(双侧检验)。
2)寻找适当的统计量,并计算相应于实际样本的统计量取值。本例采用u检验计算u值。

3)估计P值,作出统计推断。
单侧u0.05=1.645,双侧u0.05=1.96。本例为双侧检验,取u0.05=1.96,现|u|=2.67>1.96,P<0.05,因此拒绝H0,接受Ha,可以认为新型药物有效率π不等于π0(24%),新药的有效率与以往的疗法不同,较以往疗法要低。
(6)程序:采取交互式立即执行命令的方式,直接得到u值的计算结果。本例Stata命令:
![]()
(7)结果:-2.665 569 9
(8)解释:u值的计算结果为-2.665 569 9,双侧u0.05=1.96,|u|>1.96,P<0.05,因此拒绝H0,接受Ha,可以认为新型药物有效率π不等于π0(24%),根据π值(16.8%)小于π0(24%)可知,新型药物有效率不如以往所用药物。
19.2.2 两个样本率(构成比)的检验
(1)概念:χ2检验(Chi-square test):是以χ2分布为理论依据,是一种用途颇广的假设检验方法。χ2检验常用于推断两个总体率或构成比之间有无差别、两个分类变量之间有无关联、多个总体率和构成比之间有无差别等。本部分除了介绍一般四格表的卡方检验和配对四格表的卡方检验外,还深入介绍在流行病学研究中经常涉及的队列研究和病例对照研究中的卡方检验,以及Stata软件专门针对流行病学研究开发的程序,这些程序可以非常方便地计算出常用的流行病学指标。
(2)公式:两个率的卡方检验公式如下:

(3)实例:例19.8某院欲比较两种治疗方法提高男性性功能的疗效,将200例性功能障碍者随机分到治疗1组和治疗2组,结果见表19.7。问两种治疗方法对治疗男性性功能障碍的有效率有无差别?
表19.7 两种治疗方法提高男性性功能的疗效

(4)分析:用一般四格表的卡方检验来分析本例数据。四格表卡方检验的适用条件:当n≥40但有1≤T(理论频数)<5时需要用校正的卡方检验;当n<40或有T<1时,不能用卡方检验,需用确切概率法(请参见赵耐青主编的《医学统计学》第110页)。当n≥40且所有T≥5时,可用上面介绍的两个普通卡方检验公式,不必校正。Ti值=行合计×列合计/样本量n,如第一个格子的T值为174×104/200=90.48,其余类推。
(5)步骤
1)建立假设,确定检验水准。
H0:π1=π2,两种治疗方法对男性性功能障碍的疗效相同。Ha:π1≠π2,两种治疗方法对男性性功能障碍的疗效不同。检验水准α=0.05。
2)寻找适当的统计量,并计算相应于实际样本的统计量取值。本例采取卡方检验。
![]()
自由度ν=(行数-1)(列数-1)=(2-1)(2-1)=1
3)估计P值,作出统计推断。
自由度ν=1时,查出
界值
。本例χ2值12.857 1>3.841,因此P<0.05,按照α=0.05的检验水准,拒绝H0,接受Ha,即两种治疗方法对男性性功能障碍的疗效不同,治疗1法的有效率95.19%(99/104)高于治疗2法78.13%(75/96)。
(6)程序:tabi a b\c d,row chi2exact(chi2为Pearsonχ2检验,exact为Fisher确切概率法检验,row为输入基于行合计的百分数);本例Stata命令:
![]()
(7)结果

(8)解释:tabi是为一般四格表设计的Stata快捷命令。结果显示为四格表,包括频数和基于行合计的百分数,如果加col选项,还可以输入基于列合计的百分数。最下面就是Pearsonχ2统计量的值,为12.857 1,括号内是自由度ν=(行-1)(列-1),本例为ν=(2-1)(2-1)=1。本例统计量χ2=12.857 1,相对应的概率P为0.000,按检验水准α=0.05,P<0.05,故拒绝H0假设,接受Ha假设,即认为两组疗法治疗男性性功能障碍的总体有效率不同。由四格表结果可见,治疗1法有效率为95.19%,而治疗2法有效率为78.13%,故可认为治疗1法的有效率高于治疗2法。
19.2.3 病例对照资料的卡方检验
(1)概念:病例对照研究是一种分析性的流行病学研究设计,研究人群包括两组,即一组有不良健康结局的病例组;另一组为无不良健康结局的对照组。病例对照研究是以疾病或健康状态来分组的。在病例对照的研究中,从某一时间回顾测量研究对象的暴露。通过比较病例组和对照组的暴露情况,确定对危险因素的暴露与健康问题或不良健康结局是否有关联。
(2)公式:卡方检验公式如下:
![]()
(3)实例:例19.9某医生为研究室内装修作业危险因素暴露对精子质量(精子异常形态率)的影响,收集了90名精子异常形态率≥35%的男性和262名精子异常形态率<35%的男性的室内装修作业史的资料(表19.8),试分析异常形态率是否与室内装修作业有关。
表19.8 暴露室内装修作业与异常形态率的关系

(4)分析:该设计属于病例对照研究,检验病例组和对照组的暴露(室内装修作业)比例有无统计学差异。
(5)步骤
1)建立假设,确定检验水准。
H0:π1=π2,高与低的精子异常形态者室内装修暴露比例相同。
Ha:π1≠π2,高与低的精子异常形态者室内装修暴露比例不同。
检验水准α=0.05(双侧检验)。
2)寻找适当的统计量,并计算相应于实际样本的统计量取值。本例采取卡方检验。
![]()
自由度ν=(行数-1)(列数-1)=(2-1)(2-1)=1
3)估计P值,作出统计推断。
自由度ν=1时
。本例χ2值8.41,>3.841,因此P<0.05,按照α=0.05的检验水准,拒绝H0,接受Ha,即精子异常形态率高与低的室内装修暴露比例不同,前者室内装修暴露比例高于后者,因而可以认为精子异常形态率高(≥35%)与室内装修作业有关。
(6)程序:cci#a#b#c#d,本例stata命令:
![]()
(7)结果

19.2.4 配对病例对照资料的卡方检验
(1)概念:每个病例可以选择一个或几个对照,使病例与对照配成对(pair),使对照在某些因素或特征(如年龄、性别等)方面与其相配的病例相同或基本相同。这些因素或特征称之为匹配因素(matching factor)或匹配变量(matching variable)。匹配可提高病例组与对照组的可比性,并能控制某些混杂因素,从而提高研究效果,同时降低样本量。
(2)公式:配对卡方的计算公式如下:

(3)实例:例19.10某医生为研究室内装修作业对精子质量(高精子异常形态率)的影响,以相同年龄、同一社区的无其他有害物接触史的居民与有室内装修作业的配对(1∶1配对),共收集了63对资料,病例与对照均有室内装修作业暴露史27对,均无暴露史4对,病例有暴露史而对照无暴露史29对(b),病例无暴露史而对照有暴露史3对(c)(表19.9),试分析室内装修作业与精子异常形态率是否有关。
表19.9 室内装修作业暴露与异常形态率的关系(配对资料)

(4)分析:该研究属于配对的病例对照研究,病例与对照暴露不同有32对,检验病例组和对照组的暴露比例有无统计学差异。
(5)步骤
1)建立假设,确定检验水准。
H0:π1=π2,高的与低的精子异常形态者暴露于室内装修作业的比例相同。
Ha:π1≠π2,高的与低的精子异常形态者暴露于室内装修作业的比例不同。
检验水准α=0.05(双侧检验)。
2)寻找适当的统计量,并计算相应于实际样本的统计量取值。本例采取配对卡方检验。

3)估计P值,作出统计推断。
自由度ν=1时,χ20.05(1)=3.841。本例χ2值21.13,>3.841,P<0.05。因此按照α=0.05的检验水准,拒绝H0,接受Ha,即高的与低的精子异常形态者暴露于室内装修作业的比例不同,因而可以认为室内装修作业暴露与高的精子异常形态率有关。
(6)程序:mcci#a#b#c#d,本例Stata命令:
![]()
(7)结果

(8)解释:mcci是专门针对流行病学的配对病例对照研究设计的命令。在频数表后面输出的是配对χ2值(McNemar's法)=21.13和相应的P值。“Exact McNemar significance probability=0.0000”是精确概率检验的结果。“Proportion with factor”为部分输出病例组(Cases)和对照组(Controls)的室内装修作业暴露率(88.9%和47.6%)、率差difference(88.9%-47.6%=41.3%)、病例组与对照组的暴露率比数ratio(88.9%/47.6%=1.87)、与因子成比例的相对偏差rel.diff.(偏差的比例/1-对照的比例=0.787)及比数比odds ratio的值(9.67)及相应的可信区间估计(2.996 372~49.588 91)。
19.2.5 队列研究资料的卡方检验
(1)概念:队列研究是一种分析性的流行病学研究设计,研究人群由暴露于或未暴露于某一特定因素的个体组成;对二组人群进行一定时间的随访,观察某种健康结局发生与否,或某种健康问题的发展情况;据此分析暴露与预期的健康结局是否关联。
(2)公式:卡方检验公式如下:
![]()
(3)实例:例19.11假设某学者为研究电脑辐射对精子质量(精子异常形态率)的影响,对一组异常形态率<35%的人群随访了5年,其中电脑从业者99人和非电脑作业的其他从业者123人,收集了以下资料(表19.10)。结果发现电脑作业者有48人精子异常形态率从<35%变为≥35%,而非电脑从业者也有59人从<35%变为≥35%。试分析电脑辐射对精子异常形态率的影响。
表19.10 电脑辐射对精子异常形态率的影响

(4)分析:该研究属于前瞻性队列研究,随访期初精子异常形态率均小于35%,随访5年后,检测精子异常形态率是否有明显变化。分析电脑作业检验暴露组和对照组的发病率有无统计学差异。
(5)步骤
1)建立假设,确定检验水准。
H0:π1=π2,是否与从事电脑作业者的精子异常形态率≥35%的比例相同。
Ha:π1≠π2,是否与从事电脑作业者的精子异常形态率≥35%的比例不同。
检验水准α=0.05(双侧检验)。
2)寻找适当的统计量,并计算相应于实际样本的统计量取值。本例采取卡方检验。
![]()
自由度ν=(行数-1)(列数-1)=(2-1)(2-1)=1
3)估计P值,作出统计推断。
自由度ν=1时,
本例χ2值0.01小于3.841,因此P>0.05。按照α=0.05的检验水准,尚不能拒绝H0,即尚不能认为电脑作业者精子异常形态率≥35%的比例同无电脑作业暴露史者不同。
(6)程序:csi#a#b#c#d,本例Stata命令:
![]()
(7)结果

(8)解释:csi是Stata专门针对流行病学的队列研究设计的快捷命令,可以计算RD,RR,APR和PAPR。
Exposed是暴露组,Unexposed是非暴露组,Cases是病例数,Controls是非病例数。Risk difference,简称RD,是率差,指暴露组发病率和对照组发病率相差的绝对值,表示危险特异性的归因于暴露因素的程度。Risk ratio,简称RR,是相对危险度,表示暴露与发病(死亡)之间关联强度的指标。Attr.frac.ex.,记为AFe,是暴露人群的归因分值,指暴露人群内某种疾病的发病中,由该暴露引起的发病占全部发病的比例。Attr.frac.Pop,记为AFp,是人群归因分值,指总人群中某种疾病的发病,由该暴露引起的发病占全部发病的比例。Point estimate为点估计值。[95%Conf.Interval]为95%可信区间。
本例中,RD(率差)=0.005 173 7,其95%可信区间(-0.127 063 5~0.137 410 9);RR(相对危险度)=1.010 786,其95%可信区间(0.768 491~1.329 473);AFe(暴露人群的归因分值)=1.067 07%,其95%可信区间(-0.301 251 4~0.247 822 2);AFp(人群归因分值)=0.478 69%;χ2=0.01,P=0.938 9。由此可见,尚不能认为电脑作业导致精子异常形态率≥35%的比例增加。
19.2.6 行和列均无序的行×列表资料的统计分析
(1)概念:行×列表资料是医学研究中最常碰到的资料。如果行×列表资料的行变量和列变量均为无序资料,可以用Pearsonχ2(皮尔森卡方)检验来进行多组率的比较和多组构成比的比较分析。
(2)公式:卡方检验公式如下:

(3)实例:例19.12某医院欲比较三种治疗方法治疗男性性功能障碍的疗效,收集了三种治疗方法的资料如下(表19.11)。问三种治疗男性性功能障碍疗法的有效率有无差别?
表19.11 三种治疗方法治疗男性性功能障碍的疗效

(4)分析:这是一个行(R)和列(C)均为无序的R×C列表数据,分析方法可应用类似普通四格表的卡方检验。
(5)步骤
1)建立假设,确定检验水准。(https://www.daowen.com)
H0:三种治疗方法治疗男性性功能障碍的疗效相同(π1=π2=π3)。
Ha:三种治疗方法治疗男性性功能障碍的疗效(π1,π2,π3)不全相同。
检验水准α=0.05。
2)寻找适当的统计量,并计算相应于实际样本的统计量取值。本例采取卡方检验,由计算机软件计算得:

3)估计P值,作出统计推断。
自由度ν=2时,
。本例χ2值45.876 7>5.99,因此P<0.05,按照α=0.05的检验水准,拒绝H0,接受Ha,即三种治疗方法治疗男性性功能障碍的疗效不全相同。
(6)程序:tabi a b\c d\e f,row chi2。本例Stata命令:
![]()
(7)结果

(8)解释:上表中最下面就是Pearsonχ2统计量的值,为45.876 7,括号内是自由度ν=2。相对应的概率P为0.000。若检验水准设为α=0.05,P<0.05,拒绝H0假设,接受Ha假设,即认为三组病人治疗的总体有效率不全相同。从三组病人治疗的有效率来看,可以认为治疗1法(84.62%)优于治疗2法(30.30%)和治疗3法(47.12%)。
19.2.7 行变量无序、列变量有序的行×列表资料的统计分析
(1)概念:与前节不同的地方在于本节的列变量是一个有序效应的变量,这是医学研究中常见的一类问题。研究者关心的是几种方法孰好孰坏,而行与列均无序的卡方检验回答的是几种方法疗效的构成比是否相同,但构成比不同并不等价于疗效不同。此类问题可用CMH(Cochran-Mantel-Haenszel)方法通过计算行平均分检验进行统计分析。

(3)实例:例19.13某医院欲比较三种治疗方法治疗男性性功能障碍的疗效,收集的三种疗法的资料如下(表19.12)。问三种治疗男性性功能障碍疗法的有效率有无差别?
表19.12 三种治疗方法治疗男性性功能障碍的疗效(列变量有序)

(4)分析:此资料的行变量是3个治疗组,为无序变量;列变量是无效、有效、显效的疗效,为有序变量。因而该资料为行变量无序,列变量有序的R×C列表资料。采用CMH(Cochran-Mantel-Haenszel)方法计算行平均分(疗效)进行统计分析。
数据结构整理如下:

(5)步骤
1)建立假设,确定检验水准。
H0:三种治疗方法治疗男性性功能障碍的总体疗效相同
Ha:三种治疗方法治疗男性性功能障碍的总体疗效
不全相同。
检验水准α=0.05。
2)寻找适当的统计量,并计算相应于实际样本的统计量取值。本例采取CMH卡方检验计算行平均分检验进行统计分析。
行平均分检验的计算(整数给分法):疗效无效为1分,有效为2分,显效为3分。

3)估计P值,作出统计推断。
近似服从自由度ν=2的卡方分布,
。本例χ2值41.91>5.99,因此P<0.05,按照α=0.05的检验水准,拒绝H0,接受Ha,即三种治疗方法治疗男性性功能障碍的疗效不全相同。
(6)程序:opartchi列变量[fweight=频数变量],by(group)(oparchi是外部命令,需要单独下载。在Stata输入“help opartchi”,点击安装即可使用),本例Stata命令:
![]()
(7)结果

(8)解释:Independence为独立性检验,即Pearsonχ2检验,检验3个总体构成比是否相同,由P<0.05可知3个总体构成比不相同;Location是位置检验,即行平均得分是否相同。行平均得分41.91,P<0.05,拒绝H0假设,接受Ha,即三种治疗方法治疗男性性功能障碍的疗效不全相同,从三种疗法的平均分来看,
最小,说明第三种疗法(治疗组3)疗效较差,其余两种疗法疗效相似。
19.2.8 行变量和列变量均有序的行×列表资料的统计分析
(1)概念:在医学研究中,除了行无序或列有序的行×列表资料外,还有一种行和列变量均有序的行×列表资料,也很常见,比如剂量与疗效的资料。
(2)公式:CMH卡方检验公式如下:

(公式比较复杂,详情可参阅刘勤、金丕焕主编的《分类数据的统计分析及SAS编程》一书的第43页,该书于2002年由复旦大学出版社出版)。
(3)实例:例19.14假如某院比较同一药物三种剂量和提高精子密度疗效的关系,收集了如下资料(表19.13)。问药物剂量和和疗效有无关系?
表19.13 药物剂量和疗效的关系(行和列变量均有有序)

(4)分析:该资料行变量为药物剂量,分低剂量、中剂量和大剂量,为有序变量;列变量为疗效,分差、一般、好,为有序变量。故该资料行和列均有序的R×C列表资料。
(5)步骤
1)建立假设,确定检验水准。
H0:药物剂量和疗效不存在相关关系。
Ha:药物剂量和疗效存在相关关系。
检验水准α=0.05。
2)寻找适当的统计量,并计算相应于实际样本的统计量取值。本例为行和列变量均有有序的R×C列表,采取CMH方法进行非零相关的卡方检验。
![]()
自由度ν=1。
3)估计P值,作出统计推断。
Qcs近似服从自由度ν=1的卡方分布,
。本例χ2值40.69>3.841,因此P<0.05,按照α=0.05的检验水准,拒绝H0,接受Ha,即药物三种剂量的疗效不相同,疗效与药物剂量存在正相关关系,随着药物剂量增大,疗效更好。
(6)程序:opartchi列变量[fweight=频数变量],by(group)orows(oparchi是外部命令,需要单独下载。在Stata输入“help opartchi”,点击安装即可使用),本例Stata命令:
![]()
(7)结果

(8)解释:双向有序列表“Ordinal X Ordinal 2-way table”的检验“Trend in location effect”就是非零相关的检验结果,自由度ν=1,统计量=40.69,P<0.05。拒绝H0,接受Ha,认为药物剂量和疗效存在相关关系,疗效随药物剂量增加而提高。
19.2.9 多个四格表资料的分层分析
(1)概念:分层分析(stratified analysis)是按可疑的混杂因素(confounding factor)分层进行分析,以排除混杂因素的干扰,是流行病学研究在统计阶段控制混杂的常见方法。
混杂偏倚的定义:暴露因素与疾病发生的相关(关联)程度受到其他因素的歪曲或干扰。导致混杂的因素称为混杂因素,它是疾病的保护或危险因素,并与研究的暴露因素存在相关。
混杂因素的特征:①是研究疾病的独立危险因素;②与研究的暴露因素存在统计学关联;③不是暴露因素与疾病因果链中的一个环节或中间变量。
混杂偏倚判定原则:比较混杂因素调控前后的暴露因素效应估计值,如果存在专业上有意义的差异(不一定是统计学上的显著性差异),就认为产生了混杂偏倚。
混杂偏倚的控制方法:在设计阶段可以通过配比、随机化分配或限制进入(选择混杂因素的某个层的对象)等方法来控制,所以科学的设计至关重要;在统计分析阶段可以采取标准化率分析、分层分析和多变量分析来控制。
(2)公式:Mantel-Haenszel统计量公式如下:

(3)实例:例19.15有研究人员欲分析饮酒与男性性功能关系,但考虑吸烟可能是混杂因素,欲进行分层分析。具体数据如表19.14所示。
表19.14 饮酒与男性性功能关系

(4)分析:本例用以演示混杂偏倚的分层分析。该数据研究的是饮酒和男性性功能的关系,但吸烟在这里有可能为混杂因素,也对男性性功能有影响。
(5)步骤:以本例来介绍混杂偏倚的M-H(Mantel-Haenszel)分层分析。步骤:①对可能的混杂因素进行分层;②判定层间关联效应水平是否同质(判定层间RR或OR是否相近);③计算综合或调整OR(RRMH或ORMH),并与粗RR或粗OR(cRR或cOR)比较;④作出结论:一般而言,在RR或OR>1时,若差值有0.5以上的改变或在RR或OR<1时,差值有0.1以上的改变,就可以下“混杂偏倚”的结论。
数据结构整理如下:

(6)程序:cs病例变量 暴露变量[fweight=频数],by(分层变量)or(or是在病例对照研究设计中计算OR值。默认为队列研究设计,计算RR);本例Stata命令:
![]()
(7)结果

(8)解释:结果给出了是否吸烟各层的OR值和95%可信区间,以及未调整吸烟的粗RR值和调整吸烟后的调整OR值。对层间进行齐性检验,并对调整后RR进行假设检验。
本例中饮酒与不饮酒性功能吸烟层(smoke=1)的OR1=1.555 556,不吸烟层(smoke=0)的OR0=1.588 235,粗OR(crude)=3.692 308,调整OR(M-H combined)=1.570 47。层间齐性检验为χ2=0.00,ν=1,P=0.985 1。且粗OR和调整后OR有明显差别(OR>1时,差值2.12>0.5),说明吸烟对饮酒与男性性功能的关系有混杂作用。调整OR(M-H combined)95%可信区间包含1,其假设检验P值为0.65,控制吸烟的混杂后,不能认为饮酒与男性性功能有作用
19.2.10 多元logistic回归分析
(1)概念:前面讲述了单个变量的统计分析,但医学研究中经常要分析多个变量之间的关系。logistic回归属于概率型非线性回归,它是研究二分类或多分类观察结果与一些影响因素(二自变量及多自变量)之间关系的一种分析方法。在流行病学研究中经常要分析疾病与危险因素的关系。一般而言,只要结局变量是取二值的变量,分析结局变量和自变量的关系均可采用logistic回归(logistic regression)模型。
![]()
(2)公式:logistic回归公式如下:式中:p为某事件(疾病)的发生率;ln为自然对数;β0为方程中的常数项;βi为偏回归系数(i=1,2,…,m)。公式显示为假定p与1-p之比的自然对数与m个变量xi变量呈多元线性回归关系。
(3)实例:例19.16有研究人员欲比较饮酒与男性性功能关系。考虑到吸烟可能是混杂因素。数据如表19.15。
表19.15 饮酒与男性性功能关系

(4)分析:上一节介绍了混杂偏倚的M-H(Mantel-Haenszel)分层分析,该分析适用于样本量大、分析因素少的情况。本节介绍的logistic回归可用于多个危险因素的二变量结局的分析,并可用来控制混杂。logistic回归中的常数项表示在不接触任何潜在危险/保护因素条件下,效应指标发生与不发生事件的概率之比的对数值。logistic偏回归系数表示,某一因素改变一个单位时,效应指标发生与不发生事件的概率之比的对数变化值,即OR的对数值。
数据结构整理为(为演示多元logistic回归,增加了肥胖变量,共有3个自变量:smoke,drink和fat)表19.16。
表19.16 3个自变量的logistic回归

(5)步骤
1)建立假设,确定检验水准。
H0:β1=β2=…=βm=0。
Ha:βj(j=1,2,…,m)不全为0。
检验水准α=0.05。
2)寻找适当的统计量,并计算相应于实际样本的统计量取值。
本例采用似然比检验,似然比检验的基本思想是比较在两种不同假设条件下的对数似然值,看其差别大小。具体做法是先拟合一个不包含待检验因素在内的logistic模型,求出它的对数似然函数值ln L0,然后把需要检验的因素加入模型中再进行配合,得到一个新的对数似然函数值ln L1,假设前后两个模型分别包含L个自变量和P个自变量,似然比统计量G的计算公式为:
![]()
3)估计P值,作出统计推断。
G统计量近似服从自由度ν的卡方分布
。本例只控制吸烟时,ν=P-L=1-0=1,G值为8.93,>3.841,故P<0.05,拒绝H0,接受Ha。认为饮酒和男性性功能有关系。多变量回归计算方法类似。
(6)程序:logit因变量 自变量1自变量2 … 自变量m。本例Stata命令:

(7)结果

(8)解释:可以看出,没有考虑吸烟影响时,logistic回归的结果与分层分析结果一样(OR=3.69,P<0.05);对吸烟进行控制后,logistic回归的结果与分层分析结果一致(OR=1.57,P>0.05)。故可认为吸烟是饮酒和男性性功能关系的混杂因素。
如果要控制多个可能的混杂因素,将其全部放入自变量即可。如命令“logit case drink smoke fat[fweight=f],or”控制了吸烟和肥胖的可能混杂作用,饮酒的OR=1.692 778,P=0.442,无统计学意义,显示饮酒对男性性功能无作用。
从上述分析结果来看,在该分析模型有3个自变量(饮酒、吸烟和肥胖),饮酒在调整吸烟和肥胖后,显示对男性性功能没有影响;而吸烟及肥胖二变量在模型中P均<0.05,OR分别为26.37和8.20,显示即使调整饮酒和另一变量的影响,本身仍对男性性功能有明显的作用。
篇幅所限,本节仅介绍了最简单最常用的两分类logistic回归。根据影响因素(因变量)的性质,logistic回归可被分为两分类logistic回归、无序多分类logistic回归和有序多分类logistic回归三类。根据资料是否进行了配比又分为非条件logistic回归和条件logistic回归,前者适用于平行组设计的资料,后者适用于配比(matched)设计资料。详情可以参阅陈锋主编的《现代医学统计学方法与Stata应用(第2版)》第153~174页。
(廉启国)
参考文献
[1]高尔生,詹绍康,刘云嵘等主编.计划生育统计与评价.北京:中国人口出版社,1992.
[2]孙振球主编.医学统计学.北京:人民卫生出版社,2002.
[3]刘勤,金丕焕主编.分类数据的统计分析及SAS编程.上海:复旦大学出版社,2002.
[4]曹素华主编.卫生统计学方法.上海:复旦大学出版社,2003.
[5]赵耐青主编.医学统计学.北京:高等教育出版社,2004.
[6]陈锋主编.现代医学统计学方法与Stata应用.第2版.北京:中国统计出版社,2007.
[7]李立明主编.流行病学.第6版.北京:人民卫生出版社,2007.