5.2.3 实例建模

5.2.3  实例建模

1. 资料与方法

(1) 临床资料

本研究共采集符合纳入标准的341名妇女的基线资料,并签署知情同意书。随访至患者40岁,最长时限约5年,止于2016年6月。随访过程中2人行子宫切除,2人服用性激素治疗,失访21人。最终剔除25名,总纳入研究对象316名。

纳入标准:①年龄≥35岁且<40岁;②近3个月内未行激素和中药治疗,也无妊娠、流产或哺乳史;③有完整子宫和至少一侧卵巢,且经B超检查证实均无异常;④有明确自发的终末月经时间;⑤在某街道所管辖的6个社区内固定居住1年以上;⑥有良好的依从性,自愿参与本研究;⑦无恶性肿瘤、肾衰等严重合并症;⑧无多囊卵巢综合征(PCOS)、糖尿病、甲状腺和乳腺等相关内分泌疾病。

(2) 卵巢早衰诊断标准

年龄小于40岁的女性在月经第3日抽血测得FSH≥40 IU/L,至少监测两次,两次间隔不得少于1个月。

(3) 样本分配

应用SPSS 20.0统计软件包对316例样本进行无偏倚随机化分配(表5-1)。具体操作如下:软件包根据活动生成器初始化值自动得出公式“分区变量”=2×rv.Bernoulli(0.6)-1,并设置成Bernoulli变量概率参数0.6、赋值1/-1的分区值。“1”的分区值可分配70%样本(221例);“-1”的分区值可分配30%样本(95例)。再按公式“分区变量”=“分区变量”-rv.Bernoulli(0.3)重置分区变量,将分区值“1”中20%(44例)样本取值“0”,设为检验样本;80%(177例)样本仍取值“1”,设为训练样本。原分区值“-1”的95例设为坚持样本。

图示

(4) 构建人工神经网络

SPSS 20.0软件包神经网络模块中含有多层感知器,本研究利用其构建多层向前神经网络模型。本模型具有单向传播、单隐层结构、上下层全连接和每层间无连接的特点。其中,隐层节点数首先根据经验确定,在多次试验后得出最佳值。输入参数设为A型行为、腮腺炎病史、妇科手术史、促排卵药物使用史、婚育史、促卵泡激素(FSH)、促卵泡激素/黄体生成素(FSH/LH)、抗苗勒氏管激素(AMH)、抑制素B(INH-B)、窦状卵泡数(AFC)、收缩期峰流速(PSV)、阻力指数(RI)(表5-2)。各输入参数按“连续变量”和“分类变量”进行分类后,归一化到(0,1)区间。输出参数设为“是否发生卵巢早衰”,“发生卵巢早衰”编码为1,“不发生卵巢早衰”编码为0。将训练样本的输入参数输入网络。网络设置为自动体系结构选择,隐层节点数1~50,训练类别“批处理”,优化算法选用“调整的共轭梯度”,初始Lambda值0.0000005,初始Sigma值0.00005,间隔中心点“0”,间隔偏移量±0.5。网络运行后,可获得卵巢早衰预测拟概率,按0.50的分界值计算出预测灵敏度、特异度和总准确率,同时绘制ROC曲线和计算曲线下面积(AUC)。同法完成检验样本的输入并对模型进行校正,最后利用坚持样本进行模型稳定性检测。

图示

2. 结果
(https://www.daowen.com)

人工神经网络经过剔除“冗余”后,自动构建出输入单元(12个)、单隐层(6个节点)、输出单元(2个)、激活函数和激活函数模型,如图5-4所示。

图示

图5-4  人工神经网络预测模型工作

训练样本的交叉熵误差值为53.236,在预测误差未减少时中止测试,训练时间0.42s。在训练样本和检验样本的基础上,得到人工神经网络预测模型的ROC曲线,曲线下面积为0.972(图5-5)。

图示

图5-5  卵巢早衰人工神经网络预测模型的ROC曲线

当输入不同的预测变量值时,网络模型可获得不同的预测值,由此可得出各个参数对预测结果的影响权重。本研究显示影响权重值在前五位的参数分别为AMH、INH-B、AFC、A型行为、妇科手术史。所有样本通过该模型进行预测,结果显示训练样本、检验样本和坚持样本的敏感度分别为98.2%、97.8%和93.5%,特异度分别为72.3%、56.1%和45.4%,总体准确率分别为91.5%、87.6%和86.2%。

3. 讨论

多年来,国内外学者提出的卵巢早衰预测方法层出不穷。庞震苗等从流行病学角度构建了以危险因素为参数的Logistic回归预测模型;丁婷等首先以年龄、内分泌和影像学指标为基础建立回归模型,然后寻找各指标间的最佳拟合曲线并筛选出最佳参数,最后通过将预测绝经年龄分布与实际绝经年龄分布进行比较,构建出以AMH和年龄为参数的预测模型;昊日然等提出以INH和AMH为参数评价卵巢储备功能更加可靠;陈士岭等给出了预测卵巢功能降低的AFC界定值。在众多横断面和前瞻性研究中,我们不难发现以内分泌和影像学指标作为参数居多,建模方法多为经验公式或数理统计。通过比较不难发现,预测模型能获得较高临床符合率主要在于有效的参数、合适的样本量和优化的方法学三个方面。因此,上述研究在样本量受限的基础上,着重进行方法学研究,尝试将危险因素、内分泌和影像学指标作为联合参数,采用人工神经网络建模,进一步探讨最佳预测参数组合和高符合率的预测模型构建方法,旨在为经济高效预测卵巢早衰提供一种思路。

评估卵巢功能的指标诸多,上述研究共纳入12项指标作为预测变量,包括危险因素(A型行为、腮腺炎病史、妇科手术史、促排卵药物使用史、婚育史)、内分泌指标(FSH、FSH/LH、AMH、INH-B)和影像学指标(AFC、PSV、RI)。危险因素类参数为分类变量,内分泌和影像学参数为连续变量,分别进行赋值后分成因子与协变量作为输入参数,构建神经网络模型。按权重值得出预测卵巢早衰的重要影响因子分别是AMH、INH-B、AFC、A型行为和妇科手术史。这与多数学者的实验数据不谋而合,提示在后期的研究中可尝试精简参数或将新的参数与其进行重新组合,最终通过反复权重排名筛选出经济适用的输入参数。虽然本研究样本量受限,但坚持样本敏感度、特异度和总体准确率分别为93.5%、45.4%和86.2%,这是令人鼓舞的,也证实了本模型具有更好的预测效果。以后,通过新参数的设定和采用本研究的方法还可期待更高的临床符合率。那么,每位适龄妇女只要提供相应的临床信息,便可通过该模型得出是否发生卵巢早衰的预测,不仅可提前做好“计划生育”的安排,也可早诊断、早治疗,减少绝经后远期并发症。

统计学无法运用二项和多项Logistic回归对疾病进行多因素分析,同时还需要各变量必须符合正态性和独立性特点。然而,人工神经网络不仅很容易地解决了此类问题,而且可通过多台电脑输入节点实现并行计算,计算方法成熟,使用方便,适用范围广泛。但值得注意的是,人工神经网络建模依据样本数的多寡和自变量数的不同而不同,各参数影响权重受模型的变化产生差异,需要不断尝试和避免过度学习来建立最佳模型。上述研究主要立足于卵巢早衰预测的方法学探索,由于受随访时间和样本规模的限制,而且具有一定的区域性,所得模型虽然在本中心、本地区具有较高的符合度,但恐怕难以泛化。随着网络科技的发展,卵巢早衰预测模型的研究可建立在多中心和大样本之上,而且人工神经网络具有自学习和自适应能力,多中心可通过网络协作,共享样本数据,重组输入参数,以提高预测模型泛化度和准确度。人工神经网络预测模型不仅可为高效诊断及优化检查提供基础理论和方法支持,也有利于早期发现卵巢衰竭倾向,为延缓甚至逆转卵巢早衰提供机会,具有极广阔的应用前景。