动态数据的信息挖掘

(二)动态数据的信息挖掘

部分研究得到的生理数据是连续监测的时间序列数据,测量间隔通常较短且不变,对其进行分析使用实时算法,算法参数和结果随着新数据的不断加入会得到同步的优化。

1.动态系统性能评价

人体在某种程度上可以看作一个自调节控制系统,所以过程控制方法也可以应用于AMS的研究中。有研究表示,急性缺氧被认为会损害脑自动调节(CA)。CA的测量即脑血流量(CBF)对动脉血压(ABP)变化的瞬态响应,可通过与第二阶参数相关的自动调节指数(ARI)建立微分方程模型(如图17.8),包含增益(K)、阻尼系数(D)和时间常数(T)。ARI的局限性可通过提高数值分辨率和概括参数空间来解决。Panerai等使用传递函数分析和二阶微分方程仿真表明,CA的改变是缺氧的内在后果,与AMS的发生或严重程度没有直接关系。Subudhi等对高海拔地区的ARI进行评估,利用稳态振荡传递函数分析ABP和脑动脉血流速(MCAv),通过classic thigh-cuff 技术分析ABP突然大幅度下降导致的MCAv变化。发现中度低氧血症期间,非AMS患者的脑血管系统对ABP的大阶跃变化的缓冲能力可能会减弱,但仍能保持调节缓慢的节律性振荡的能力,ARI在高海拔地区依然是评价CA的有效指标。

图示

图17.8 常氧(黑色)和缺氧(阴影)下休息4分钟后ARI的阶跃响应

高碳酸血症可能和AMS的发生有关。Chacón等为检测高碳酸血症中CA的受损程度,使用支持向量机(SVM)进行学习和验证,建立以ABP作为输入和CBF速度(CBFv)作为输出的非线性模型。动态SVM的实现依赖移动平均或自回归结构,动态CA的效率是根据模型推导出的CBFv对BP阶跃变化的响应作为线性和非线性模型的自调节指标来估计的。Subudhi等为证明缺氧和CA受损之间有关联,通过傅里叶反变换对脑调节系统的脉冲响应和阶跃响应进行预处理,并使用中值滤波器和Butterworth滤波器对其进行连续平滑处理;引入Welch算法的傅里叶变换具有256个节点的窗口和40%的重叠,从而产生了至少5个数据段。对这些数据段的平均相干性、增益和相移进行评估,最后对增益和相位进行上述傅里叶变换,得到时域的脉冲响应和阶跃响应。

2.时间序列分析(https://www.daowen.com)

一些研究通过时间序列数据设计了新指标,可以更直观地分析动态数据与AMS之间的关系。Beidleman等提出了一种新的低氧剂量指标:累积的海拔暴露量(AAE)。计算方法为:上升至4000m之前到达的海拔高度和上升至该海拔所用的天数的乘积,并将其作为自变量,将暴露于4300m约24 h后AMS的患病率作为因变量,建立了bootstrap-logistics定量预测模型。暴露于低氧环境后,血氧饱和度会下降直至动态平衡,此过程所用的时间也可能会是有效的指标。氧气储备指数(ORI)是新的连续无创变量,由使用多波长脉冲共血氧测定法的新一代脉搏血氧仪提供。虽然目前并未发现AMS相关研究将ORI作为参考指标,但ORI具有优秀的表示氧合作用、血氧水平的能力,也许将来会成为实时监测AMS的有效指标。

序列信息的挖掘可以帮助分析或诊断病理状态,例如可将HRv数据在时域中的变化规律作为指标评估AMS的严重程度。常用的时间序列模型有自回归模型、滑动平均模型、自回归滑动平均模型和自回归积分滑动平均模型等,时间序列复杂性常用维数、熵、李雅普诺夫指数等来衡量。熵具有很多变体如样本熵(Sampen)、近似熵(Apen)、模糊熵(FuzzyEn)、Kolmogorov-Sinai熵和光谱熵。有文献对比了样本熵、近似熵和模糊熵对生理数据集处理的能力。近似熵适用于嘈杂的中型数据集,广泛应用于各种生理和临床数据集,例如遗传序列、激素脉动性、呼吸模式、心率变异性、心电图、脑电图和肌电图。但是,近似熵是有偏差的统计数据,缺乏相对的一致性,对数据长度的依赖性很大。样本熵可以缓解自匹配引起的偏差,具有相对一致性,并且对数据长度的依赖性较小。其向量的相似性定义还是基于近似熵中的Heaviside函数。由于Heaviside函数的固有缺陷,在熵定义的有效性方面仍然存在问题,特别是在涉及小的参数时。模糊熵源自Zadeh模糊集的概念,具有较强的相对一致性,对数据长度的依赖性较小,偏差较小,而且可以实现连续性,更自由的参数选择以及对噪声的鲁棒性。样本熵、近似熵、模糊熵和Renyi熵在HRv分析上的应用已经十分普遍,鉴于HRv和AMS的紧密关联,熵分析方法也许对AMS的生理数据挖掘表现较好的效果。

血氧饱和度变异性(OSv)领域目前鲜少研究,Bhogal等使用规律性(样本熵分析)、自相似性(去趋势波动分析)和复杂度(多尺度熵分析)来表示OSv的特征,通过这几个参数,OSv可能可以作为研究AMS的有效指标。

3.机器学习

在AMS预测方面,神经网络可以自主学习模型参数,克服相关指标繁多、内部机制不明确等难点,更好地拟合数据并生成鲁棒性更强的模型。游海燕针对AMS易感性预测建立了学习向量量化(Learning Vector Quantization,LVQ)模型,平均正确预测精度达到72.22%,初步实现对AMS易感人群的筛选。目前AMS相关研究中较少使用误差反向传播(Back Propagation,BP)模型,但在其他医学研究中,BP模型已经显示出较好的鉴别与预测效果。如有文献通过建立BP模型鉴别2型糖尿病肾病。

循环神经网络(RNN)和长短期记忆网络(Long Short-Term Memory,LSTM)是时间循环神经网络,是更适合时间序列数据的深度学习网络。LSTM对HR数据、睡眠监测数据等具有较好的分析能力,并在很多疾病的预测中已被广泛应用。Mishra等利用信息挖掘和分类技术,设计了一个动态LSTM冠状动脉疾病预测模型,该模型可在HR动态数据集上边学习边预测。Maragatham等提出的基于LSTM的心率衰竭预测模型在网络的隐藏层中使用SiLU和tanh作为激活函数,在输出层中使用Softmax,在整个网络权值优化的正则化中使用Bridgeout。根据实时数据进行的评估显示出该模型在心衰风险预测中的有效性和可行性。另外,有文献为了确定各种病症诊断结果与睡眠的关系,建立了基于LSTM的循环神经网络模型。数据中的各项指标均来自匹兹堡睡眠质量指数量表。先对数据进行标准化预处理,再采用逐步线性回归方法选取几个比较重要的指标,同时基于上述模型预测在不同指标值下患每种病的概率,最后再与原数据中的实际诊断结果进行比较分析,得出诊断结果与睡眠的关系。目前尚未发现对AMS的研究引入LSTM,但以上研究所使用的数据和AMS相关生理数据类似,由此推测,LSTM对AMS的鉴别和预测可能会有较好的效果。