5.1.4 讨论

5.1.4  讨论

Logistic回归是按统计学的思路和方法来分析数据,通过假设检验来做统计推断。根据计算分析各个变量的回归系数对应变量的影响大小来对变量进行筛选并建立回归模型。与线性回归不同,Logistic回归是一种非线性模型,普遍采用的参数估计方法是最大似然估计法。Logistic回归模型对样本量有着严格的要求,国内学者张文彤建议Logistic回归最低样本量的估计方法,首先选择应变量中较少的那一类,然后将数值除以10,得到的数值即为模型中可以分析的自变量数,否则会出现迭代不收敛、增删几例后参数估计值出现剧烈波动、极宽的可信区间等情况。当样本量很小时,对于概率估计值和置信区间的解释就必须十分谨慎。但这一标准并不是强制标准,也有学者提出在样本量小于100时使用最大似然估计风险较大,但样本量大于500时就显得比较充分。样本量的确定依赖于模型和数据的特点。首先,如果在模型中有很多参数要估计时,就需要较多的观测案例。其次,要是数据条件不太好,如自变量之间有高度共线性或应变量的变化太小等,就需要较大的样本。


(https://www.daowen.com)