算法过程的标准化、可靠性及QC
关于DL算法过程的标准化,存在以下几个需要注意的问题。首先,用于生成算法的数据由不同的开发人员或公司用不同的模型进行分析。这就需要DL训练方法和系统QC的标准化,以减少不同仪器产生的系统误差和随机误差,因为大数据中的单个噪声就会导致分类错误和改变对DS图像的预测结果,最终可能导致大量假阳性或阴性。其次,积累的数据越多,算法越准确,特别是针对少见疾病和特定病种的少数人群样本,要保证足够的训练和测试数据集的样本或特征含量。最后,由于不同的数据资源在实际应用中可能会导致分类精度的差异,因此需要采用标准的数据格式和数据分析的规范化方法,将来自不同资源的连续数据集合并成一种算法。最近,DICOM标准提供了一种对基于WSI的DS图像的解决办法,即通过一种方法将多帧图像和不同分辨率的多个图像合并为一张平铺的大图像来进行处理(http://dicom.nema.org/Dicom/DICOMWSI/)。
目前,多种因素导致对DL算法很难建立严格的QC步骤。首先,关于图像分割问题。训练任何机器学习算法的一般原则是将带标注的数据分成“训练”和“测试”数据集,并确保这些数据集在评估性能时是独立的。算法应该在训练集上训练,然后应用到测试集上,最后将结果与测试集相关的“地面真实”进行比较。然而,细分步骤的QC可能会受到“病理诊断金标准悖论”的影响。也就是病理医师对组织病理学的评估被认为是诊断结果的金标准,但事实上算法数据可能比人类评估更具有可重复性。通过将算法数据与患者的实际结果进行比较,然后来验证病理医师的人工评估/评分结果,看看算法数据是否能达到或超过病理医师的诊断结果,这可能会在一定程度上克服这一问题。(https://www.daowen.com)
其次,使用DL的一个主要问题是,很难理解用于做决定的一些特征和神经通路的工作过程,即DL预测结果的可解释性。特别是,当DL不经过图像分割步骤对特征图像进行直接自动从图像中提取用于与临床最终结果相关的特征给出相应预测时,对这个过程的解释特别具有挑战性,有时很难理解机器算法为什么会得出这样的结论。因此,ANN特别是DNN经常被人们称为“黑盒”。于是,对于性能或表现不佳的算法就难以纠正。由于算法过程缺乏透明度、可解释性和可证明性,人们(至少是病理医师)难免怀疑机器算法生成的预测结果的可靠性。为此,有人努力将DL算法转换为一个透明可见的“玻璃盒子”,明确输入特征及其与测量输出的关系,使其更容易被人类使用各种技术进行解释[290,291]。通过向病理医师提供有关该算法在特定实例中使用的组织病理学特征的信息,可以培养对该算法的信任,并可以实现病理医师和机器算法两者之间的协同,其较高的可靠性可能超过CPATH辅助工具或病理医师单独的预测和评估[292]。
最后,基于WSI的DS图像在DP中的成功应用,取决于生成DS图像的玻璃切片的质量和扫描过程。切片质量包括从取材直到染色封片等制片环节的每一步。组织贴片折叠,染色变化和封片过程中的气泡,扫描时的亮度、对比度、颜色均一化、边界强度设置等,都会由于DS图像的质量问题导致原始数据不可靠和预测结果的准确性[293,294]。