5.3 Logistic回归模型与人工神经网络模型的比较
如果说Logistic回归建模过程是在“白盒子”(意为可以透视其中)里进行,那么人工神经网络的建模过程就是在“灰盒子”(意为可以模糊看见其中)里进行。人工神经网络对已知输入和输出信息的学习,通过隐含层的数学函数建立其两者之间的关系。神经网络的参数可以比统计方法的自变量多很多,由于参数如此之多,参数通过各种各样的组合方式来影响输出结果,以至于很难对一个神经网络表示的模型做出直观的解释。可将全部数个预测变量设置成人工神经网络的输入层参数,神经网络根据参数的特点自动剔除冗余单元,并自动设置隐含层的单元数,并在输出结果中列出自变量的重要性,这一点对发现研究线索和潜在变量有一定的意义。
两种模型各有优缺点,归纳起来如下。
1. Logistic回归模型
(1) 优点 ①理论基础完善,应用范围广泛。该模型所用的假设简单,既不要求满足误差分布趋于正态分布假设,也不要求自变量符合正态分布的条件,能对分类应变量和分类自变量、连续自变量、混合变量进行回归建模,模型的应用范围很广。②模型解释性较好,能用于二分类变量的判别并计算出其归属的概率,可以给出判别结果在概率意义上的解释,有一整套成熟的对回归模型和回归参数进行检验的标准。
(2) 缺点 建模过程烦琐,对模型的解释需要较深厚的数理统计基础,易出现数据结构问题,如空单元、多元共线性等问题。(https://www.daowen.com)
2. 人工神经网络模型
(1) 优点 ①可以解决统计学中诸如二项及多项Logistic回归问题等对疾病的相关多个影响因素进行分析评价,而且人工神经网络不要求变量满足正态性和独立性等条件,比统计学的应用范围更大;②很容易在并行计算机上实现,可以将其节点分配到不同的CPU上并行计算;③建模过程中,很多算法技术已经比较成熟,可以作为工具直接使用。
(2) 缺点 ①对人工神经网络的建立没有固定的模式可循,数据量的大小、变量的数量不同,建立的模型也不同,对于哪种模型更好也需要不断尝试。对疾病危险因素的分析是建立在模型之上,不同的模型其得出的自变量的重要性权重也是不一样的。在这方面的研究不如统计学理论化、系统化;②人工神经网络会学习过度,在训练神经网络时一定要恰当地使用一些能严格衡量神经网络的方法。
以上两种模型各有优点,在卵巢早衰预测领域中仅是一种方法学上的初步研究,尚需进行大样本多中心的求证,这种探索旨在完善卵巢早衰的防治策略,做到真正意义上的防微杜渐,合理规划。