19.1 计量资料的数据分析
计量资料(measurement data),又称定量资料(quantitative data)或数值变量(numerical variable)资料,为测定每个观察单位的某一项指标大小而获取的资料,其变量值是定量数值,一般有度量单位,如身高(cm)、体重(kg)和血压(mmHg)。
19.1.1 单个样本均数的t检验
(1)概念:单样本t检验(one sample t-test)是一种关于总体均数的假设检验。在这种检验中只有一个随机抽取的样本,研究目的是推断该样本所对应的总体均数是否等于(或大于,或小于)某个已知总体均数。
(2)公式:t检验(t-test)公式
![]()
式中
为样本均数;μ为总体均数;sx-为样本均数标准误;ν为自由度(degree of freedom)。
![]()
式中:s为样本标准差,n为样本的个体数。
(3)实例:例19.1已知正常男性的精子密度为20×106/ml(μ)。为研究饮酒对精液质量的影响,某研究者随机抽查了20位(n)有饮酒史的成年男性,测得精子密度为18×106/ml
,标准差为4.8×106/ml(s)。请问,根据此数据能否说明有饮酒史的成年男性的精子密度低于正常男性的精子密度?
(4)分析:此研究目的是,有饮酒史的成年男性的精子密度是否低于正常男性的精子密度,即假设有饮酒史男性的精子密度不会高于正常男性。采用单个样本均数的t检验(单侧检验)来分析。总体均数μ=20×106/ml,样本容量n=20,样本均数
,样本标准差s=4.8×106/ml(以下计算时,将对指标的单位及数值予以简化)。
(5)步骤:一般有三个步骤。
1)建立假设,确定检验水准。
H0(无效假设):μ=20,即有饮酒史的患者的精子密度与正常男性相同。
Ha(备择假设):μ<20,即有饮酒史的患者的精子密度低于正常男性。
检验水准:α=0.05(单侧)。
2)寻找适当的统计量,并计算相应于实际样本的统计量取值。假设精子密度服从正态分布(t检验的应用要求变量总体分布呈正态),所以根据本例的样本资料可计算得样本t值:t=
3)用计算得的t值,与tα(ν)比较,估计P值,作出统计推断
当H0成立时,统计量t服从自由度ν=n-1=20-1=19的t分布。因为本例是一个单侧检验,α=0.05,查阅t界值表t0.05(19)=1.729,而|样本t值|=|-1.863 4|=1.863 4,大于1.729,P<0.05。因此拒绝无效假设H0,接受备择假设Ha,μ<20,即可认为有饮酒史患者的精子密度低于正常男性。
(6)程序:ttesti样本例数 样本均数 样本标准差 已知总体均数,本例Stata命令:
![]()
(7)结果

(8)解释:结果包括两部分。第一部分是关于分析变量的描述和均数估计,包括样本例数n(Obs)、均数
、标准误(Std.Err.)、标准差(Std.Dev.)、总体均数的95%可信区间([95%Conf.Interval])和自由度ν(degrees of freedom)。
第二部分是假设检验的结果。Stata自动给出了三种假设检验的结果,即结果中的①Ha:mean<20。②Ha:mean!=20。③Ha:mean>20。其中①和③是单侧检验,②是双侧检验。本例是为了说明有饮酒史的成年男性的精子密度是否低于正常男性,属于单侧检验,取①Ha:mean<20的结果,P=0.039,故按α=0.05的检验水准,可认为有饮酒史的成年男性的精子密度低于正常男性。
19.1.2 配对资料均数的t检验
(1)概念:配对t检验(paired t-test)又称成对t检验(matched t-test),适用于配对设计的计量资料。配对设计的资料是指观察值是一对一的资料,常见的情况有:①在同一对象的两个部位测量同一指标所得的数据;②对同一样品应用两种不同方法测量同一指标所得的数据;③对同一对象两个不同时间点上测量同一指标所得的数据;④其他配对设计资料(如孪生兄弟的身高、体重和精液质量指标值)。
(2)公式:配对t检验公式

(3)实例:例19.2为研究某种药物对治疗男性少精症的效果,某医生选取了12名少精症患者进行为期一个疗程的治疗,治疗前后的数据见表19.1,请做统计推断,分析该药物治疗男性少精症是否有效果。
表19.1 12名少精症患者治疗前(x1)后(x2)的精子密度(106/ml)

(4)分析:该资料为配对计量资料,相应的统计方法为配对t检验。配对计量资料t检验先求每对数据的差值d,然后再检验这些差值(d)的总体均数
是否为0(即无差别)。
(5)步骤:有以下三个步骤。
1)建立假设,确定检验水准。
H0:μ=0,即该治疗不会提高患者的精子密度,即μd=mean(x1-x2)=0
Ha:μ<0,即该治疗可以提高患者的精子密度,即μd=mean(x1-x2)<0
检验水准:α=0.05(单侧检验)
2)寻找适当的统计量,并计算相应于实际样本的统计量取值。假设精子密度服从正态分布,那么根据本例的样本资料可计算得样本t值:
![]()
3)估计P值,作出统计推断。
当H0成立时,统计量t服从自由度ν=数据对子数-1=12-1=11的t分布。因为本例是一个单侧检验,查阅t界值表t0.05(11)=1.796,而样本|t|值=|-2.800 7|=2.800 7,>1.796,P<0.05。因此拒绝H0,接受Ha,可认为该治疗有效,可以提高患者的精子密度。
(6)程序:ttest变量名1=变量名2,本例Stata命令:
![]()
(7)结果

(8)解释:结果显示ttest默认选项是配对t检验(paired t test),如果是成组t检验,后面需要加个unpaired选项(见本节19.1.3部分)。
与单个样本均数t检验一样,Stata结果也包括两部分。第一部分是变量的对子数(Obs)、均数(Mean)、标准误(Std.Err.)、标准差(Std.Dev.)及95%可信区间([95%Conf.Interval]),第二部分是假设检验的结果。本例是检测药物是否有效,为单侧检验t=-2.800 7。参考左侧的结果P=0.008 6,即P<0.05,故按α=0.05的检验水准,可认为该药物可以提高精子密度(但需注意,统计学检验有差别不一定说明该药物治疗少精症临床有效)。
19.1.3 两个样本均数的t检验
(1)概念:两样本t检验(two-sample t-test)又称成组t检验(two-group t-test),适用于完全随机设计的两样本均数的比较,此时欲推断的是两个样本均数所代表的两个总体均数是否不等。两样本t检验的使用条件为每组资料近似呈正态分布(或大样本)并且两组资料方差齐性。
(2)公式:成组t检验公式

(3)实例:例19.3为比较饮酒者的精子密度和不饮酒者(对照)的精子密度是否相同。某医生选取了12名有饮酒史和11名无饮酒史的男性,对其精液密度进行测量,结果如表19.2,试分析饮酒与否的男性精子密度是否有差别。
表19.2 饮酒组的精子密度和对照组的精子密度(106/ml)

(4)分析:这里共有23个数据(第一组12个,即n1=12;第二组11个,即n2=11),本例不是如配对资料那样数据成对。两组的数据毫无关联,相互独立,这种样本资料称为独立样本资料,两组样本例数(n1和n2)可以相同,也可以不同。相应的统计方法为两样本t检验。如果满足每组资料近似呈正态分布(或大样本)但方差不齐,则可用两样本t′检验,分析命令需要加选
择项unequal,Stata将进行t′检验。
(5)步骤
1)建立假设,确定检验水准。
H0:μ1=μ2,饮酒者的精子密度和不饮酒者的精子密度相同。
Ha:μ1≠μ2,饮酒者的精子密度和不饮酒者的精子密度不同。
检验水准:α=0.05。
2)寻找适当的统计量,并计算相应于实际样本的统计量取值。

3)估计P值,作出统计推断。
可计算得样本t值=-2.155 5。因为本例是双侧检验,且样本|t|值>t0.05(双侧)界值,P<0.05,拒绝H0,接受Ha,认为饮酒者的精子密度和不饮酒者的精子密度不同。
(6)程序:ttest变量名1=变量名2,unpaired,本例Stata命令:
![]()
(7)结果

(8)解释:结果提示,进行的是方差齐性下的成组t检验。与单个样本均数t检验一样,Stata结果也包括两部分:第一部分是变量的例数(Obs)、均数(Mean)、标准误(Std.Err.)、标准差(Std.Dev.)及95%可信区间([95%Conf.Interval])。第二部分是假设检验的结果。本例为比较饮酒者的精子密度和不饮酒者的精子密度是否相同,为双侧检验,t=-2.155 5。参考中间部分(双侧检验)的结果,P=0.042 9,故按α=0.05的检验水准,认为饮酒者的精子密度和不饮酒者的精子密度不同。
19.1.4 多样本均数比较的方差分析
(1)概念:多组均数的比较不能用多次t检验解决(这样会增加犯Ⅰ类错误的概率),可用本节介绍的方差分析解决。方差分析的基本思想就是把数据变异的来源分解为离均差平方和与自由度,然后借助F分布作统计推断。本节重点介绍完全随机设计资料的方差分析(analysis of variance,ANOVA)。完全随机设计是采用完全随机化的分组方法,将全部试验对象分配到g个处理组(水平组),各组分别接受不同的处理,试验结束后比较各组均数之间的差别有无统计学意义,推论处理因素的效应。
(2)公式:方差分析计算公式如下:

(3)实例:例19.4为研究甲、乙、丙三种药物治疗少精症的药物的疗效,某医师将11例患者完全随机分为3组,分别给予三种药物治疗,一个疗程后的结果整理见表19.3,请作统计分析,推断三种治疗药物的疗效是否不同。
表19.3 三种药物治疗少精症一个疗程后精子密度增加数(106/ml)

(4)分析:该设计是完全随机设计,采用完全随机设计资料的方差分析进行统计检验。
数据结构整理为表19.4。
表19.4 分组与精子密度增加数(106/ml)

(5)步骤
1)建立假设,确定检验水准。
H0:3个总体均数全相等(μ1=μ2=μ3),即甲、乙、丙三种药物治疗少精症的疗效相同。
Ha:3个总体均数不全相等,即甲、乙、丙三种药物治疗少精症的药物疗效不都相同。
检验水准:α=0.05。
2)寻找适当的统计量(本例为F值),并计算相应于实际样本的统计量取值。
组间离均差平方和
组间自由度
组间均方
组内离均差平方和
(https://www.daowen.com)
组内自由度
组内均方
F=MS组间/MS组内=7.43
3)估计P值,作出统计推断。
查F0.05(ν组间,ν组内)分布表,F0.05(2,8)=4.46,而样本的F值7.43>4.07,P<0.05。因此按照α=0.05的检验水准,拒绝H0,接受Ha,甲、乙、丙三种药物治疗少精症的药物的疗效不全相同。
(6)程序:oneway分析变量名 分组变量名。本例Stata命令:
![]()
(7)结果

(8)解释
见结果(7)和表19.5。
表19.5 方差分析表

其中,最后一行“Bartlett's test for equal variances: chi2(2)=0.9853 Prob>chi2=0.611”是方差齐性检验,P=0.611,即不能认为3个总体的方差不等,即可认为满足方差齐性的要求;若方差不齐(即P<0.05),则不能进行方差分析。方差分析的结果F=7.43,P=0.015,故按α=0.05的检验水准,可以认为治疗少精症的三种药物的疗效不全相同。
19.1.5 线性相关分析
(1)概念:本节前面讲述的都是单个变量的统计分析,医学研究中还经常要分析变量之间的关系,如年龄与血压、辐射剂量与精子密度。线性相关(linear correlation)与回归就是分析两个变量之间线性关系的统计方法,属于双变量分析。
(2)公式:相关系数计算公式如下:

(3)实例:例19.5根据表19.6数据,计算禁欲时间(x1,天)与精子密度(y,106/ml)之间的相关系数。
表19.6 禁欲时间与精子密度(106/ml)的关系


本例:t=r/Sr=5.070,ν=n-2=5-2=3。
3)估计P值,作出统计推断
查t界值表,双侧t0.05(3)=3.182,|t|>t0.05(3),故按照0.05的检验水准,认为总体相关系数不等于0,即精子密度(106/ml)与禁欲时间(天)之间存在直线相关关系。
亦可查r界值表,r=0.946>r0.02(3)对应的值0.934,P<0.02,故认为精子密度(106/ml)与禁欲时间(天)之间存在直线相关关系。Stata软件采用的检验统计量是后者。
(6)程序:pwcorr变量1变量2,sig star(0.05)(sig指对相关系数进行统计检验,star是按照括号内的检验水准加星号标注);本例Stata命令:
(4)分析:线性相关就是研究两个变量间是否存在数量相关关系,若存在相关关系,这样的两个变量之间的关系就称为线性相关关系,简称相关。判断两个变量间是否存在相关,可以先做散点图来进行初步判断,如果散点基本上呈直线趋势,随着一个变量的增大另一个变量也相应增大,为正相关;如果随着一个变量的增大另一个变量相应减小,为负相关;如果随着一个变量的增大另一个变量不受影响,为不相关。
描述两个变量间直线关系的密切程度和相关方向的统计指标是相关系数,样本相关系数用r表示,总体相关系数用ρ表示。样本相关系数(r)没有单位,且-1≤r≤+1。r值为负说明负相关,r值为正说明正相关,若r值为-1或+1,说明完全相关;若r值为0,说明零相关,即完全不相关;|r|值越接近1,两变量直线关系越密切。需要注意的是,r值仅表示两变量间直线关系的密切程度,当r值很小甚至等于0时,不一定代表两个变量就不存在其他数量上的关系(如指数、对数等曲线关系)。
(5)步骤
1)建立假设,确定检验水准。
H0:ρ=0,总体相关系数等于0。
Ha:ρ≠0,总体相关系数不等于0。
检验水准:α=0.05。
2)寻找适当的统计量,并计算相应于实际样本的统计量取值。采用t检验对相关系数进行检验。

(7)结果

(8)解释:从散点图来看,禁欲时间与精子密度两个变量存在直线相关关系。本例两变量的相关系数为0.946 3,对应的P值为0.015,P<0.05,故按α=0.05的检验水准,认为禁欲时间与精子密度两变量之间存在直线相关关系。需注意的是,相关并一定是因果关系,不一定表示一个变量的改变是另一个变量变化的原因,而可能受其他因素的影响;相关系数接近于零并不意味着两变量间一定无相关性,有可能存在曲线相关。
19.1.6 一元线性回归分析
(1)概念:在研究两个变量之间的关系时,当散点图成直线趋势,且相关系数的假设检验有意义时,可以进一步从一个变量的数值推算另一个变量的数值。描述两变量的数量关系时可进行线性回归(linear regression)分析。线性回归是回归分析中最简单的形式。
(2)公式:一元线性回归方程的形式如下:

(3)实例:例19.6根据表19.6数据,试计算其直线回归方程。
(4)分析:直线回归分析的任务是找出描述两个变量之间关系的直线方程,以确定一条最接近各点的直线,使各个实测点至直线的纵向距离的平方和最小。统计上称这个方程是直线回归方程,这条直线就叫做回归直线。回归系数反映了自变量x对因变量y的影响,当x变化一个单位时,y相应地平均变化b个单位。线性回归模型的应用要满足3个条件:
1)因变量y与自变量x存在线性关系;
2)各例观测值yi相互独立;
3)残差服从均数为0,方差为σ2的正态分布。
(5)步骤
1)建立假设,确定检验水准。
H0:总体回归系数等于0,即β=0。
Ha:总体回归系数不等于0,即β≠0。
检验水准:α=0.05。
2)寻找适当的统计量,并计算相应于实际样本的统计量取值。采用方差分析对回归系数进行检验。

3)估计P值,作出统计推断。
查F0.05,(ν1,ν2)界值表(ν1为自变量个数,ν2为样本量减去2,即n-2)。本例F0.05,(1,3)=10.13,F>F0.05,(1,3),P<0.05。故按照0.05的检验水准,拒绝H0,接受Ha,总体回归系数不等于0,即认为精子密度(106/ml)与禁欲时间(天)存在线性关系。
一元线性回归分析时,亦可用线性相关系数(r)的检验代替回归系数(b)的统计学检验,理论上两者等价,即一元线性相关关系成立,一元线性回归方程也成立。
(6)程序:reg因变量 自变量;本例Stata命令:
![]()
(7)结果

(8)解释:结果输出了回归模型的一般资料:模型、残差和总离均差平方和(SS)、自由度(df)及均方(MS);观察例数(Number of obs),方差分析检验统计量F的取值F(1,3),P值(Prob>F),决定系数(R-squared),调整决定系数(Adj R-squared),误差均方平方根(Root MSE)。此外,还输出了回归方程中回归系数和常数项的估计值、估计值的标准误、t检验统计量取值、P值和95%可信区间。决定系数R2是一个重要的指标,定义为回归平方和与总平方和之比,取值在0~1之间且无单位,数值大小反映了回归贡献的相对程度,也就是Y的总变异中回归系数所能解释的百分比。本例校正后的决定系数为0.860 6,方差分析检验统计量有统计学意义,P=0.014 8。
本例输入计算出回归方程Y=3.76x1+54.7,即回归系数b为3.76,常数项a为54.7。回归系数假设检验的统计量t=5.07,P=0.015,故按α=0.05的检验水准,认为禁欲时间(天数)与精子密度两变量存在直线回归关系。
19.1.7 多元线性回归模型
(1)概念:实际的科学研究中,对某一个指标产生影响的往往是多个因素,本节介绍的线性回归模型是分析多个因素(多个自变量)对一个指标的影响,而上节介绍的两变量(一个自变量,一个因变量)线性回归为线性回归模型的特殊情况。
(2)公式:线性回归模型的一般形式如下:

(3)实例:例19.6根据表19.6数据,试计算精子密度(y)与禁欲天数(x1)和精液量(x2)的直线回归方程。
(4)分析:与直线回归相同,多元线性模型(multiple linear model)的参数估计可以用最小二乘法得到。多元线性回归模型的应用要满足3个条件:
1)因变量y与各自变量xi存在线性关系;
2)各例观测值yi相互独立;
3)残差服从均数为0、方差为σ2的正态分布。
(5)步骤
1)建立假设,确定检验水准。
H0:总体回归系数全等于0,即β1=β2=…=βm=0。
Ha:总体回归系数不全等于0,即β1,β2,…,βm不全为0。
检验水准:α=0.05。
2)寻找适当的统计量,并计算相应于实际样本的统计量取值。采用方差分析对回归系数进行检验。

3)估计P值,作出统计推断。
查F界值表,F0.05,(2,2)=19.00,本例F=293.63,>F0.02,(2,2),故P<0.05。按照0.05的检验水准,拒绝H0,接受Ha,认为总体回归系数不等于0,即认为禁欲时间和精液量与精子密度存在线性关系。
(6)程序:regress因变量 自变量1自变量2 … 自变量m。本例Stata命令:
![]()
(7)结果

(8)解释:结果输出了回归模型的一般资料:模型、残差和总离均差平方和(SS)、自由度(df)及均方(MS);观察例数(Number of obs),方差分析检验统计量的取值F(2,2),P值(Prob>F),决定系数(R-squared),调整决定系数(Adj R-squared),误差均方平方根(Root MSE);此外,还输出了回归方程中回归系数和常数项的估计值、估计值的标准误、t检验统计量取值、P值和95%可信区间。本例校正后的决定系数为0.993 2,方差分析检验统计量有统计学意义,P=0.003 4。
本例输入计算出回归方程Y=-81.550 65-10.683 53x1+80.241 84x2。式中:x1为禁欲天数;x2为精液量。禁欲时间回归系数假设检验的统计量t=-5.69,P<0.05,精液量回归系数假设检验的统计量t=7.72,P<0.05,且回归方程的F检验P<0.05,故按α=0.05的检验水准,认为精子密度与禁欲时间(x1)和精液量(x2)两变量均存在直线回归关系。
值得注意的是,禁欲天数(x1)在上节和本节的回归方程的回归系数方向并不一致(前者为3.76,后者为-10.68),即在上节中禁欲天数(x1)与精子密度是正相关,而在本节中禁欲天数(x1)与精子密度是负相关。出现这种结果的原因是禁欲时间(x1)和精液量(x2)两变量有可能不独立,多元回归模型变量间存在共线性,甚至多个变量之间存在复杂的多重共线性。
所谓多重共线性(multicollinearity)是指线性回归模型中的自变量之间由于存在精确相关关系或高度相关关系而使模型估计失真或难以估计准确。多重共线性会导致难以区分每个解释变量的单独影响、回归模型缺乏稳定性及t检验的可靠性降低等问题。可以采用系数判定法、逐步回归判别法及方差膨胀因子VIF判别法等办法来判别模型变量间是否存在多重共线性。分析时可以通过剔除引起共线性的变量、增加样本量及采用综合变量(主成分分析)和应用逐步回归分析法等来解决多重共线性问题。详情可以参阅孙振球主编的《医学统计学》第253页,亦可参阅其他统计专业书籍。