计量资料的统计描述
(一)集中趋势的描述指标
集中趋势是指一组计量资料的集中位置,说明这组变量值的平均水平,用平均数描述。常用的平均数有均数、几何均数和中位数3种。
1.均数 是算术平均数的简称。总体均数用希腊字母μ表示,样本均数用
表示。均数最适用于对称分布资料,特别是正态分布资料。其计算方法如下:
(1)直接法:当样本含量较少时,可将各变量值相加除以变量值个数,即得均数。
![]()
式中X代表各变量值,Σ是求和的符号,n为样本含量。
【例8-2】 测得10名健康人的白细胞总数(109/L)分别为5.50、7.00、8.20、4.80、6.70、5.75、6.10、9.30、7.60、7.15。试计算均数。

(2)加权法:当样本含量较多时,可先将各变量值归纳分组编制频数表,用加权法求均数。设分为K组,每组的频数为fi,各组变量值的均数用其组中值X=(本组段下限+下组段下限)/2代替。计算公式为:

式中f为频数,X为相同变量值或组中值,Σf即样本含量n,k为组数。
【例8-3】 根据表8-1所给资料计算均数。
先编制频数表如表8-3,然后按公式(8-2)计算如下:

表8-3 120名正常人125I-T3比值均数加权计算表

2.几何均数 用G表示。适用于偏态分布资料、变量值呈倍数关系的资料,特别是当变量值取对数后呈对称分布的资料。计算方法有两种:
(1)直接法:当样本含量不多时,其计算公式为
![]()

上式可化为对数式【例8-4】 设有4份血清的抗体效价为1∶10,1∶20,1∶40,1∶80,求其平均效价。该资料可根据公式(8-4),用变量值的倒数计算其几何平均数。

这4份血清的抗体平均效价为1∶28。
(2)加权法:当样本含量较多时,先将变量值归纳分组成频数表,再用下式计算

式中f与X分别为相应组的频数和变量值。
【例8-5】 某地13人接种某疫苗后测得血清抗体滴度分组统计如表8-4,试求平均滴度。

这13人的平均抗体滴度为1∶65。
表8-4 13人血清抗体滴度几何均数计算表

3.中位数和百分位数 把一组变量值从小到大排列,位次居中的变量值称为中位数,用M表示。百分位数是一个位置指标,用Px表示。将一组变量值由小到大排列,分为100等份,每份含1%的变量值。Px将全部变量值分为两部分,理论上有x%的观察值比它小,有(100-x)%的观察值比它大。中位数是一个特定的百分位数,即P50。中位数常用于描述偏态分布资料,特别是分布规律不清楚,一端或两端无确定数值,无法计算均数和几何均数的资料。
(1)中位数的直接计算法:当n较小时先将变量值由小到大排列。
当n为奇数时,其计算公式为:M=![]()
【例8-6】 9个人某病的潜伏期为2、3、3、3、4、5、6、9、16天,求中位数。
本例n=9,为奇数,代入公式(8-6),得:M=![]()
当n为偶数时,其计算公式![]()
【例8-7】 8个人某病的潜伏期(天)为5、6、8、9、11、11、13、>16,求平均潜伏期。(https://www.daowen.com)
![]()
8名病人的平均潜伏期为10天。
(2)百分位数计算方法及中位数的频数表计算法:当n较大时,先编制频数表,按所分组段由小到大计算累计频数和累计频率。先从累计频率找出Px所在组段,Px所在的组段为累计频率首次?x%的组段,然后按下述公式计算其百分位数Px及中位数M(P50)
![]()
式中fx为Px所在组的频数,i为该组段的组距,L为其下限,ΣfL为<L的各组段累计频数。
【例8-8】 238名正常人的发汞值如表8-5的第(1)、(2)栏,求中位数和百分位数P75。
由表8-5的第(4)、(1)栏可见,M(P50)在1.1~组段。现L=1.1,i=0.4,fx=60,ΣfL=86,代入公式(8—8)得:M=1.1+
(238×50%-86)=1.32(μg/g)
同样可得:P75=1.5+
(238×75%-146)=1.77(μg/g)
238名正常人的发汞值的中位数为1.32μg/g,P75为1.77μg/g。
百分位数常用于确定医学参考值范围(即正常值范围)。习惯上是确定只包括95%的特定健康状况人群的界值。如确定白细胞总数的95%参考值范围,应分别计算P2.5及P97.5,<P2.5和>P97.5均属异常;确定肺活量95%参考值范围,应计算P5,<P5为异常;确定发汞值95%参考值范围应计算P95,>P95为异常(表8-5)。
表8-5 238名正常人发汞值(μg/g)中位数和百分位数计算表

(二)离散趋势的描述指标
【例8-9】 有3组同龄男孩体重(kg)如表8-6,试对资料的特征作出描述。
3组均数相等
,但各组数据离散程度不同,表达离散趋势常用的指标有全距、方差、标准差、变异系数和四分位数间距。
1.全距 用R表示,是一组数据中最大值与最小值的差。全距大说明变异度大;反之说明变异度小。如上例R甲=34-26=8kg,R乙=36-24=12kg,R丙=34-26=8kg,说明乙组离散程度较大。全距用来表达变异度大小,简单明了,但不能反映组内所有数据的情况,如上述甲、丙两组资料,靠近中心的两个数据离散程度不同,但其全距相同。
表8-6 三组同龄男孩体重(kg)

2.方差和标准差 为了克服全距的缺点,应全面地考虑组内每个变量值的离散程度,即考虑总体中每个变量值与总体均数μ之差(离均差)。由于离均差有正有负,数学上可以证明Σ(X-μ)=0,故将离均差平方后再相加,得离均差平方和Σ(X-μ)2,离均差平方和除了与离散程度有关外,还与变量值的个数N的大小有关。为了消除N的影响,可取其平均值表示离散程度,称总体方差,用σ2表示。
![]()
由该式可见,各个离均差平方后,原来的单位都变成了平方单位。为了还原为原来的度量单位,可将总体方差开方,即得总体标准差

实际工作中得到的资料通常是样本资料,μ一般未知,只能用
估计,用样本例数n代替N。英国统计学家W.S.Gosset提出用(n-1)代替n来校正,使样本标准差s成为总体标准差的无偏估计值,于是上式变为

式中s表示样本标准差,(n-1)统计学上称自由度,意义是随机变量能“自由”取值的个数。数学上可以证明Σ(X-
)2等于ΣΧ2-(ΣΧ)2/n,上式可演变为

用公式8-12分别计算表8-6中3组男孩体重的标准差如下:s甲=3.1623kg,s乙=4.7434kg,s丙=2.9155kg。结果说明3组男孩体重平均水平相同,但离散程度不同,乙组男孩变异程度最大,甲组次之,丙组变异程度最小。
当样本含量较大时可利用频数表,采用加权法计算,其公式如下

在医学论文中常将标准差与均数结合起来描述对称分布的计量资料。其意义为:当两组(或几组)资料均数相近、度量衡单位相同时,标准差大表示变量值的变异度大,各变量值离均数较远,均数的代表性较差;反之,标准差小表示变量值的变异度小,各变量值离均数较近,均数的代表性较好。
3.变异系数 若比较度量衡单位不同或均数相差悬殊的两组(或几组)资料的变异度时,应计算变异系数。变异系数用CV表示,其计算公式如下:
![]()
【例8-10】 某地7岁男孩身高均数为123.10cm,标准差为4.71cm;体重均数为22.29kg,标准差为2.26kg,试比较身高、体重何者变异度大。

由此可见,7岁男孩体重的变异度大于身高的变异度。
表8-7 某地不同年龄儿童身高(cm)的变异度

表8-7资料说明,当均数相差较大时,比较变量值的变异度,不能用标准差,应采用变异系数分析,从变异系数可以看出6岁以下儿童随年龄增加,其身高的变异度逐渐减小。