数据资源及其可用性限制

一、数据资源及其可用性限制

CPATH所面临的数据资源限制体现在两个方面。一方面,用于DL训练的临床数据来源和获取比较困难。在信息化与AI融合的进程中,各种数据就变成了宝贵的资源。而各种DL算法的开发又非常依赖数据,而且需要的数据量也很大。尤其是在CPATH领域,与传统的图像分析手动选择“重要的目标特征”相比,ML可以自动识别这些特征。对于监督学习而言,除了原始图像集之外,数据集中必须包含一些地面真实数据的元素,以提供适当的可供参考的诊断环境。然后,训练算法才能在提供的地面真实数据的指导下预测或描述图像。这些地面真实可能来自患者结果数据,例如,从病理报告中的组织学类型和分级信息、LIS中提取的实验室检查结果,一些病例的特定检查记录(分子检测数据)等,也可以是病理医师审核病例时专门为支持算法训练而手动提供的一些素材。然而,获取这些适合于算法开发的临床地面真实数据通常是非常困难的,因为每个医疗机构对这些临床数据都视为一种宝贵的资源和财富,特别是使用多个机构的大量临床地面真实数据构建临床验证集时,涉及不同的权属和未来的利益归属问题,所需的临床数据来源就变成了一个非常复杂的问题。另一方面,即使能够获得一定的临床数据,这些数据的可用性也存在很大问题。因为这些数据之间存在着非常大的差异,除去患者临床资料(病史、实验室结果等)的可靠性之外,能够收集到的病理样本就存在诸多可变性:①数据集样本和算法无法适合所有的训练流程;②由于HE切片质量标准和规范的不一致而使得DS图像质量可能影响DL学习训练的结果,特别是来自多个医疗机构的切片更难以做到质量上的同质化;③图像预处理和人工控制不仅耗时且具有一定的挑战性。在将数据合并到算法之前,可能需要人工手动或自动对入组数据进行筛选和DS图像标注。即使是训练有素的病理专家在进行图像标注时,有时也难以保证为DL建立一个充分准确的数据集,导致这种情况的原因多种多样:缺乏经验、时间有限、长时间工作的乏味及厌倦感,有时可能还与费用有关等。(https://www.daowen.com)

对于病理样本的变异性要给予充分的重视并通过一定的方法加以改进。第一,通过使用流线型的工作流程和具有直观用户界面的单一通用标注工具,可以明显简化创建和共享手动区域标注的任务。第二,由于避免了在多个系统[286]上安装特定的软件,基于web的工具可能是不同研究组之间共享标注结果的理想工具。第三,通过对拟入组的病理标本采取统一规范的组织处理和染色程序,应用手动或自动的图像质量控制过程,使用更大更有代表性的训练集,以及对每个实验室的算法进行校准,可以在一定程度上缓解入组资料的变异性。第四,也可以应用图像预处理策略,如颜色归一化[287]减少DS图像染色色度差别的影响。第五,可以考虑增加预期的地面真实数据收集量来监视和优化学习训练性能。