18.1 资料分类与统计指标
18.1.1 统计资料
一般原始数据可分为计量资料(measurement data)和计数资料(enumeration data)两大类。计数资料又称作属性资料。
用定量的方法对每个观察单位测定某一指标数值的大小,这样所得的资料就称为计量资料,例如精液量、精子密度、血清睾酮浓度、血清锌浓度等指标;每一个研究的男性对象都有实验室对这些指标测量得到的检测数量值。
将观察单位按某种属性和类别分组,然后清点各组的观察个数,这样的资料称为计数资料,如精子是否存活,精子形态是否正常,精液的颜色(灰、黄、棕),某位男子和他的妻子是否已怀孕过,这些资料都属于计数资料。需要注意的是,如精子是否存活,观察单位是“一个精子”,而不是一个男性对象。这里的一个精子是否存活、精子形态是否正常是计数资料。如对一个男性研究对象,对他的精子存活状态进行检测,检验200个精子,结果是121个精子胞膜完整,其精子存活率为60.5%,则此资料为计量资料,因为此时观察单位是“一个男性”,而不是一个精子。因而确认一个指标是计量指标或计数指标,需判断观察单位的数值是“是”与“否”,还是某一测量指标的数值(字)大小。
介于计量资料与计数资料之间的是等级资料,也称半定量资料。如精子的活动力指标分为0,Ⅰ,Ⅱ,Ⅲ,Ⅳ五个等级,将每个精子的活动力状态确定后分入0~Ⅳ中任一组,再清点0,Ⅰ,Ⅱ,Ⅲ和Ⅳ各组的精子个数。
18.1.2统计学基本概念
(1)总体与样本:总体(population)是根据研究目的而确定的同质研究对象的全体。例如2002年上海市计划生育研究所对中国六省市20~60岁一般健康男性进行了精液质量调查,则中国六省市20~60岁健康男性为总体,它的同质基础是:中国六省市(地区),2002年(时间),同为20~60岁健康男性(人群)。如总体中包括有限个单位,就称为有限总体。如总体中观察单位数是无限的,就称为无限总体。从总体中抽取一部分个体作为调查/研究的对象,就称为样本(sample)。被研究的样本对于总体应具有好的或较好的代表性。样本所包含的个体数称为样本大小,或称样本含量。
(2)统计量与参数:总体的统计指标称为参数,如有总体均数(μ),总体标准差(σ),总体相关系数(ρ),总体率(π)等;样本的统计指标称为统计量(statistics),如样本均数
,样本标准差(s),样本相关系数(r),样本率(p)等。研究的目的是从样本统计量推论总体的参数,如从
推论μ,称为点估计。
(3)随机化:在总体中抽取样本进行研究时,必须实施随机化原则,特别是在实验室条件下和药物的临床试验中。在流行病学研究中,也应尽量实施随机化,使样本对总体有好的代表性。随机化原则,就是使总体中的所有个体有同等被抽入为样本的机会。有很多随机化的技术和方法,如随机数字表、计算机随机数字自动生成程序、抽签法等。
(4)概率:统计中所讲的概率(probability)就是某一事件发生的可能性大小,常用P表示。P的值在0~1之间,概率越接近0,事件发生的可能性越小;概率越接近1,表示事件发生的可能性越大。不可能发生事件的概率为0,必然发生的概率为1。通常认为事件发生的概率P≤0.05时,则认为这是小概率事件;而0.1≥P>0.05时认为事件发生的概率比较小,亦称边际小概率,特别当样本量不太大时,还是具有一定的统计学意义。
18.1.3 计数资料的统计指标
计量资料与计数资料所显示其特征的统计指标不相同。计量资料一般用平均数(算术均数、中位数及几何均数)表示其平均水平;而计数资料一般用率、构成比及相对比表示所显示之事件的特征(事件发生频率、分布及相互关系)。下面先介绍计数资料常用的统计指标。
(1)率(rate):率就是指某一确定人群中某一事件的发生频率,表示某事件在人群中发生的强度。一个率由分子(发生数A+)、分母(可能发生的总数A)组成,分子是分母的一部分(A=A++A-)。
率=某事件(发生)数/确定人群总数=A+/(A++A-)(%)
分子、分母代表的是同一人群,如分子被限定在某地区、某年龄、某职业内,则分母应亦有同样的限定。
例:2002年上海市计划生育研究所在中国六省市对20~60岁一般健康男性进行精液质量调查,测定了男性的精液量,并应用WHO参照值以<2ml为“少精液症”予以纪录。浙江省A市调查合格男性206人,精液量<2ml为124人,贵州省B市调查合格男性199人,精液量<2ml为137人。比较二市调查对象的少精液症患病率。
A市少精液症患病率=124名少精液症对象/206名合格调查对象=60.2%
B市少精液症患病率=137名少精液症对象/199名合格调查对象=68.8%
(2)构成比(proportion):构成比是指事物的一个部分占事物全部的比例(或比重),表示一个事物的存在状态。因为分子是分母的一部分,因而一个构成比的数值在0~1之间。构成比一般用百分比表示,事物的全部构成比之和就是100%,即1。这里的事物可以是二分类的,也可以是多分类的。
Ai的构成比=Ai/A(%)
i=1,2,…,n A=A1+A2+…+An
例:2000年上海市计划生育研究所在中国七省市调查了732名男子的精液质量,精液的颜色为灰白色481名,乳白色201名,浅黄色50名。计算各种颜色精液的构成比。
灰白色精液比例=481/732=65.71%
乳白色精液比例=201/732=27.46%
浅黄色精液比例=50/732=6.83%
(3)相对比(ratio):相对比表示为两个事物(或事件)的相对情况。
相对比=A事件数(值)/B事件数(值)
分子A和分母B不是同一个事物,因而相对比的值可以呈现为任何数,可以从0到∞(无穷大);相对比的分子与分母可以是二个计数值的比,亦可以是二个计量值的比。
例:计算上述率和构成比例子中的A市与B市少精液症的相对比和灰白色精液对乳白色及浅黄色精液数的相对比。
A市/B市少精液症率的相对比=60.2%/68.8%=0.875
灰白色精液/浅黄色精液数的相对比=481/50=9.62
乳白色精液/浅黄色精液数的相对比=201/50=4.02
上述结果显示:A市少精液症的患病率是B市的87.5%;灰白色精液人数为浅黄色精液人数的9.62倍,而乳白色精液人数是浅黄色精液人数的4.02倍。
(4)患病率与发病率:流行病学中最常用的疾病度量指标是患病率和发病率。
时点患病率(point prevalence rate,PR)是表示某一时间点总人数中患某疾病人数的比例。
PR=某时间点的病例数/总人数(%)
分子中包括所有在某时间点的患病人数,而不管个体患病时间的长短。(https://www.daowen.com)
例:2008年某医生在河南汉族人群研究体重指数(BMI)与精液质量关系,共调查298人,调查时BMI>30的肥胖者为63人,则该人群肥胖的患病率为:
PR=63/298=21.14%
发病率(incidence rate,IR)是指在某时期内暴露于某危险因素人群中新发生的病例数。
某精液质量低于WHO参照值标准的异常率是为一种患病率,100%减异常率为WHO参照值的符合(大于参照值)率。如上述的少精液症、少精子症、无精子症、畸精子症等均为患病率。
IR=某时期内新发病例数/危险暴露人群总数(%)
例:某地居民反映该地含苯生产的化工厂建立一年来,当地356名男性中有38人自感性功能下降(以往正常),计算性功能下降发病率:
IR=38/356=10.67%
18.1.4 计量资料的统计指标
(1)均数与标准差:计量资料通常用平均数(average)及标准差(standard deviation)表示一组数据的平均水平(或集中趋势)及其离散水平。直接将所有个体的值相加后除以个体数为算术均数,简称均数(mean)。总体均数用μ表示,样本均数用
表示。
![]()
例:某单位调查7名男子的精子密度(×106/ml)分别是38,42,43,50,61,63,72,则该单位7名的平均精子密度为:
![]()
对一组计量数据除用x表示平均水平的特征外,通常还用标准差表示它的离散程度。标准差越大,表示数据离散度越大,反之离散度越小。总体标准差以σ表示,样本标准差用s表示。样本标准差的计算公式:
![]()
式中:
为离均差平方和,即每一个个体值减均数后平方,再将所有平方加和,即为离均差平方和;n-1为自由度,亦用n′表示。上例中七名男子精子密度的离均差平方和为:

需注意,均数和标准差数值均是有单位的。
(2)中位数与百分位数(median,M and percentile,Pi):将变量值由小到大排列后,位置在中间的这个数值为中位数。将所有个体变量按大小排列,处于第10%位大小的变量,称第10百分位数(P10),第50%位大小的变量,为第50百分位数,以此类推。各种分布类型的数据都可用中位数表达其平均水平。若在一组的变量数据中,大多数据比较集中,少数数据偏向一侧时,或者当资料的分布不清楚时,或数据两端有不确切值时,不适宜应用算术平均数表示它们的平均水平,而适宜应用中位数。中位数数值也可以有单位的。中位数的公式:
![]()
计算上例7名男子精子密度的中位数时,将n=7代入公式为:
![]()
样本量为奇数时,中位数即为个体数值按大小排列后,位于中间个体(本例为第4个对象)的数值即x4的值。若样本含量为偶数时,则位于中间二个个体数值的平均值为中位数,公式:
![]()
例:某单位8名男子的精子前向运动率分别是35%,38%,40%,41%,42%,43%,50%和65%,则该8名男子中位精子前向运动率为:

当样本量很大时,样本数据输入计算机后,应用统计软件,可很快计算并获得中位数值。中位数亦称为第50百分位数(P50),此时数据的离散程度常应用四分位间距(P25~P75)表示,在P25~P75值之间包括了50%的个体值。P25为第25百分位数,亦称第1四分位数,P75第75百分位数,亦称第3四分位数。
(3)几何均数(geometric mean):几何均数用于表达一套是呈对数正态(或对称)分布数据的平均水平,通常用于抗体滴度及某些血清微量元素表示其平均水平。几何均数用G表示:

由公式可知,几何均数的计算是n个值的乘积开n次方,或先将个体值取对数(lgx),再求对数的均数
,然后再取反对数(lg-1)。几何均数用手工计算十分繁冗,借助于计算机软件可十分容易实现。对数正态(对称)分布的数据,亦可在用标准差的公式求对数数据的标准差,由此可以进行各种统计分析。
(4)个体值的分布及其应用:若将一个大样本的个体值(比如说500个或1 000个)求最大值与最小值之差[亦称全距(range),用R来表示],然后等距分成15~20几个组,观察个体值在各组的分布。数据的分布一般呈三种:正态分布(A),正偏态分布(C)和负偏态分布(B)(图18.1)。

图18.1 正态分布和偏态分布曲线
正态分布的特征:①均数位于分布的中间;②两侧对称;③在
间的正态分布曲线下的面积占95%。不少人体体质指标的值接近正态分布,故以95%范围为正常参照值。因而公式
被广泛地应用为正常参照值的计算公式。
2002年上海市计划生育研究所调查了1 191名20~60岁一般健康男性的精液质量,精子存活率平均值69.95%,标准差12.98%,估计的95%正常参照值范围为:

若数据值呈偏态分布,则95%参照值范围常用百分位法,即P2.5~P97.5。P2.5为第2.5百分位数,P97.5为第97.5百分位数。
2002年1 191名20~60岁一般健康男性的精子存活率的中位数(M)为70%,P2.5~P97.5为39%~90%,与由
公式计算得的数值较接近。如资料分布呈明显偏态时,两者可有较大的差别,因而P2.5~P97.5用于偏态资料时会更好。这里要强调的是,精子存活率测量的个体是一个男子,因而这样的资料是计量(亦称定量)数据,可以用
表达这组数据的平均水平及其离散程度。