5.1.2 建模
在流行病学的研究中,主要关注的是疾病发生的频率(P)。假设暴露因素与疾病的发生频率呈线性关系,即P=β0+βx,则可能出现P值大于1或小于0,则无法从医学意义上进行解释。那么,假设暴露因素与P/(1-P)的对数呈线性关系:
ln[P/(1-P)]=y=β0+βx (5.10)
从上述算式中可得出:
P=(eβ0+βx)/(1+eβ0+βx) (5.11)
或P=1/[1+e-(β0+βx)] (5.12)
上式称为Logistic回归模型。假如有多个自变量,则多变量的Logistic回归模型为:

或

(https://www.daowen.com)
此为Logistic模型的基本结构。
Logistic回归模型主要是当结果变量(因变量)是分类变量,而需要分析该因变量与多个变量(包括分类变量和数值变量)的关系时常用的多因素回归模型。模型建立后,还要对回归方程进行检验,主要包括回归方程的显著性检验、回归系数的显著性检验、回归方程的拟合优度检验以及Logistic回归模型中的参数估计及意义解释。
基于危险因素与卵巢早衰的发生率关系密切,我们可以考虑建立一个通过危险因素对卵巢早衰发生进行预测的模型。那么,以卵巢早衰作为二分类的因变量,卵巢早衰记为1,卵巢不早衰记为0。采用Logistic回归方法研究卵巢早衰的相关因素,是否早衰作为被解释变量(1/0二值变量),其发生的概率为P。其余各暴露因素为解释变量,为避免出现某些因素因交互影响而被剔除的可能性,采用Backforward方法,进入方程的显著性水准为0.05,剔除的水准为0.10。
庞震苗等选择广州市3家三甲医院经内分泌、彩超检查确诊的卵巢早衰患者79例。按病例对照原则,同期在广州市机关、企业、学校、工厂选取年龄、工作环境、受教育程度相似的健康妇女进行同地调查,按1∶2原则,获得符合条件者200例。采用统一编制的危险因素调查问卷,通过专人面对面方式询问获取问卷。对回收的问卷经检查合格后按不同组别进行编号。最后将统计数据输入计算机,建立数据库,采用SPSS软件对数据进行统计分析。结果模型线性显著性和拟合性较好,得出如下Logistic回归方程式:

其中P为早衰发生的概率,n代表各个危险因素变量。上式反映了各解释变量与卵巢早衰发生概率P/(1-P)的对数呈线性关系。虽然常数项的P值大于给定的显著性水平,但是将其纳入方程也没有实际的影响,所以方程中仍然存在常数项。
Logistic回归模型具有预测作用,运用所得到的数学模型,就可以对卵巢早衰患病的可能性进行预测,即当大致了解一位女性的生活及病史情况后,就可以根据模型估算出其卵巢早衰患病的概率。