5.1.1 原理

5.1.1  原理

Logistic曲线又称蒲尔里德曲线,该曲线最早由比利时学者Verhulst于1838年提出,后来失传。1920年,美国学者Pearl和Reed在研究果蝇的繁殖中重新发现该曲线,并开始在人口估计和预测中推广应用。随着计算机的快速发展,Logistic曲线被广泛应用于医学领域。Logistic曲线属于概率型非线性回归模型,是研究分类观察结果与一些影响因素之间关系的一种多变量非线性分析方法。Logistic回归分析根据应变量取值类别不同,又可以分为二分类Logistic回归分析和多分类Logistic回归分析。二分类Logistic回归分析中应变量只能取两个值——1和0(虚拟应变量),而多分类回归分析中应变量可以取多个值。本研究只应用二分类Logistic回归,以下简称Logistic回归。Logistic回归模型基于以下理论依据。

假设有一个理论上存在的连续反应变量代表事件发生的可能性,其值域为负无穷至正无穷。当该变量的值跨越一个临界点C(比如C=0),便导致事件发生:当变量>0时,yi=1,在其他情况下,yi=0。这里,yi是实际观察值的反应变量,yi=1表示事件发生,yi=0表示事件未发生,假设在反应变量和自变量xi之间存在一种线性关系:

yi=α+βxii  (5.1)

由式(5.1),我们得到:

P(yi=1/xi)=P[(α+βxii)>0]

=P[εi>(-α-βxi)]  (5.2)

通常,假设式(5.1)中误差项εi有Logistic分布或标准正态分布,为了取得一个累积分布函数,一个变量的概率需要小于一个特定值,所以我们必须改变式(5.2)中不等号的方向,由于Logistic分布和正态分布都是对称的,因此式(5.2)可以改写为:

P(yi=1/xi)=P[εi≤(α+βxi)]

=F(α+βxi)  (5.3)

其中F为累积分布函数,分布函数的形式依赖于式(5.1)中的εi假设分布,如果假设其为Logistic分布,就得到Logistic回归模型。因为不能直接观察,其量度即不能由Logistic回归模型来决定,在Logistic回归模型中,误差项的方差可以使累积分布函数取得一个较为简单的公式:

P(yi=1/xi)=P[εi≤(α+βxi)]=1/(1+e-εi)  (5.4)

这一函数为Logistic函数,它具有S形分布,如图5-1所示。

图示

图5-1  Logistic函数的图像

正如图所示,无论εi取任何值,Logistic函数P(yi=1/xi)=1/(1+e-εi) 取值范围在0与1之间。Logistic函数的这一性质保证了由Logistic模型估计的概率决不会大于1或小于0。根据Logistic函数取得Logistic回归模型,公式重写为:(https://www.daowen.com)

P(yi=1/xi)=1/[1+e(α+βxi)]  (5.5)

式中,xi为自变量;α和β分别为回归截距和回归系数。

将事件发生的条件概率标注为P(yi=1/xi)=Pi,就能得到下列的Logistic回归模型:

图示

式中,Pi为第i个案例发生事件的概率,它是一个由解释变量构成的非线性函数,然而这个非线性函数可以被转变为线性函数。

首先,定义不发生事件的条件概率为:

图示

那么,事件发生概率与事件不发生概率之比为:

图示

这个比被称为事件的发生比,即odds,odds一定为正值,因为0<Pi<1,并且没有上界,将odds取自然对数就能够得到一个线性函数:

图示

从式(5.9)我们可以看出,当odds从1减少至0时,Logit(y)取负值且绝对值越来越大;当odds从1增加到正无穷时,它取正值且绝对值越来越大。一个变量的作用如果是增加对数发生比的话,也就是增加事件发生的概率,反之亦然。Logistic回归在定性和半定量资料的判别和预测方面有一定的优势,在应用Logistic回归进行判别分析时,在保证训练样本代表性的基础上,用逐步回归过程对指标进行筛选,挑选出对应变量作用最大的指标建立回归方程,通过组内回代、组外考核和拟合优度检验等方法检验判别效果。