深度学习算法训练的基本流程

二、深度 学习算法训练的基本流程

DL算法和所采用的策略种类众多,而且,随着时间的推移,还会有更多不同的算法和新型策略出现。虽然CAPDS的研发工作主要由数据科学家和算法工程师完成,但是,最终的应用领域却是病理科/实验室,而使用人员则是病理医师。因此,CAPDS的可靠性和可用性评价及结果质控等必须由病理医师来完成。对DL算法训练流程的适度了解,有助于病理医师在使用CAPDS时对结果的可靠性和可信性进行有效的评价和取舍。DL算法的基本流程大致可以分为病理标本的选择、玻璃切片数字化和图像标注、建立算法和图像分析、DL模型训练、学习和验证以及算法优化五个步骤。

(一)用于训练的病例及其临床病理资料的选择

相关患者及其临床病理资料的选择是构建训练算法的第一步。训练集和验证集都必须包含所有与预期预测疾病相关的样本类型或亚型,例如,肿瘤组织病理学的结果中要包括分期、分级、组织学分类及伴发疾病(如结直肠癌旁是否同时伴有腺瘤)等,以尽量避免假阴性和假阳性等情况的出现。虽然患者和标本的筛选在很大程度上是一个由机器驱动的过程,但软件算法无法识别没有包含在训练集中的变量。标本和后续训练集所用切片的选择标准需要由经验丰富的病理医师和计算团队共同拟定。容易或可能造成混淆的因素必须被排除在训练集和验证集之外。例如,拟入组的肿瘤患者因为其他严重基础疾病导致的死亡,可能会影响DL算法对该肿瘤生存期的预测结果。另外,质量较差的玻璃切片如模糊不清、染色过深或过浅、气泡和组织折叠等均可能导致数字化扫描失败或产生质量有缺陷的DS图像,最终导致DL算法训练、验证和预测结果的失准。所以,在选择相关患者及其临床病理资料时,必须对每项应纳入的原始数据和相应的临床资料以及实验室结果进行全面的严格筛选。所选择的患者及其临床病理资料与预期目标的关联度越高,得到的DL算法模型的预测值就越准确,就越容易在真实的临床环境中通过验证。

(二)玻璃切片数字化

DL训练算法的构建是基于DS图像进行的,包括组织学特征识别和目标区域标注。这是训练算法构建的必经之路。玻璃切片数字化的原理、DS图像的生成过程及DPS的组成在第一章已经详细介绍。在适用的分辨率下,DS图像的文件大小取决于玻璃切片上的扫描区域。一般来说,标准扫描区域的切片其DS图像都比较大,目前平均大小在1 GB左右。因此用于算法学习训练的电脑应该是一台容量大、速度快的数字病理计算工作站。而且,用于临床学习训练的算法所需的DS图像数量可能因组织类型和诊断而有所不同。除此之外,不同的WSS所生成的DS图像在算法训练中的表现也存在差异,文献[213]研究显示在徕卡Aperio和飞利浦智能病理解决方案(Philips IntelliSite Pathology Solution)两种WSS所生成的DS图像中,亮度、对比度和清晰度的差异对算法训练的预测性能有着很大的影响。所以,对于DL训练算法的构建来说,选择合适的WSS也是很重要的环节。关于DS图像的质量控制,一些高端WSS都具有自动纠错和质量不佳的DS图像自动略过的无人值守功能,使这些不合格的DS图像得以重新扫描,以改善用于图像分析算法的DS图像质量。另外,一些基于DL算法的DS图像自动识别系统也逐步应用到WSS中以监督识别扫描模糊不清的图像,使DS图像的质量保持稳定。例如,Senaras等[214]提出的DeepFocus新型深度学习框架的自动识别DS图像中的模糊区域,Janowczyk等[215]开发了一款名为HistoQC的开源工具,可以评估每张DS图像的颜色直方图、亮度和对比度,并识别队列级别的异常值(例如,比队列中其他切片颜色更深或更浅)。

(三)开发建立算法模型及图像标注分析

基于WSI的DS图像的组织学信息特征非常丰富,其中一些目标特征以前只能由受过训练的病理医师或生物技术专家通过视觉获取,这些专家必须具有丰富的专业知识和经验,而且需要经过图像标注和分析方法的培训。这种人工手动标注很容易受到以前固有认知和视觉偏差的影响。而现在,随着各种基于高容量深度神经网络模型的智能图像算法识别器的改进,病理医师可以从大量的对每个DS图像的像素级手工标注中解放出来,既可以提高图像标注效率,将更多精力放在其他临床工作上,同时又降低了固有经验和视觉偏差带来的影响。

利用ML数字图像分析工具,可以从DS图像中标注提取用于建立训练模型的常见测量类别有三种:分别是基于组织区域、细胞及组织中除细胞外的相关目标特征的测量。其中最常见的方法是将DS图像分割成具有相关特征的多个细小的组织碎片(patch)图像,用于训练诊断或预后任务的分类器模型。例如,利用CNN和RNN在HE染色的DS图像上进行的多实例的肿瘤分类训练;应用深度半监督架构和辅助分类器生成一个包括生成器网络和一个鉴别器网络的对抗神经网络自动分析PD-L1在晚期非小细胞肺癌穿刺活检免疫组化切片中的表达;弹性净线性回归模型和权重优势投票系统对多形性胶质母细胞瘤和低级别胶质瘤的鉴别等。另外,国内在利用DL学习算法构建训练模型用以建立对某些疾病的CAPDS方面的研究也如火如荼,特别是用于宫颈液基细胞筛查的CAPDS等辅助工具已经在不同程度地应用于临床筛查中,在显著减轻细胞病理医师劳动强度的同时,也提高了工作效率。

(四)DL模型数据集的训练、学习和验证

当按照研究预期收集到的相应病例形成训练集后,基于上述图像分析的初步数据,在病理医师的参与下,数据科学家会按照临床预期开发出一种基于训练集、测试集和独立验证集的算法。这个过程包括定义预处理步骤、初步分析阶段和全面的DS图像数据分析如原始数据的采集、组织图像分割、特征识别、存储和处理,对数据进行统计分析等。然后应用训练集对所建立的算法按照预先选定的特征目标进行反复训练学习。在图像分析中,分析验证通常是通过与所谓的“地面真实”标准进行比较来实现的。目前,通常认为病理医师对图像进行视觉观察的结果代表了“地面真实”,例如,如果比较几张理想图像上Ki67阳性细胞的CAPDS工具计数的准确与否,必须以相同DS图像区域的规范化人工细胞计数作为参考标准。在这种情况下,确定“地面真实”有时会很困难,需要详尽规范并且是可重复的人工计数方法,并接受当前以病理诊断金标准作为参考方法所存在的不足,如参与的病理医师的经验和诊断能力等因素的影响。因为,观察者间的可变性和主观性意味着一个病理医师的观察和标注不一定百分之百是“地面真实”。所以,对拟临床应用的DL模型通常需要多个病理医师和多个实验室进行验证和测试。

(五)算法优化及临床应用模型形成

在这个反复训练的过程中,不可避免地会出现与预期结果不一致或一定的偏差,有时训练集的结果表现很好,但测试集的结果却并不理想,这就需要对训练集和测试集的目标特征参数进行不断的调整、改进、优化以获得良好的训练学习工具和尽可能完备的训练学习方法。经过长时间反复的不断训练学习,最后必然产生一个最终的最大限度地接近“地面真实”的数据集,该数据集可证明用于监管批准和认证的应用程序的有效性,即形成临床应用的CAPDS。CAPDS上市前的临床验证必须经过在大型患者非选择性和盲法数据集中进行的高水平试验。例如,在神经内分泌肿瘤中计数Ki67从而对肿瘤进行分级时,必须对一个病理科/实验室一段时间内所有的神经内分泌肿瘤在CAPDS与病理医师之间进行比较,才能真正了解验证所使用的CAPDS的性能表现。但是,对于许多CAPDS来说,在算法和模型训练中可能很难获得“地面真实”的数据,而且可能缺乏可比较的所谓“金标准”测试指标供临床病理医师使用。在这种情况下,对CAPDS的验证将主要是临床试验性验证,并依赖于在具有详细结果数据的大型患者队列中进行稳健和可重复的验证[216]。问题是临床验证所需的大型患者队列相对缺乏,主要原因是涉及患者资料的私密性及监管部门对医疗机构患者资料的管理限制等,而那些有机会接触这些数据的公司或人员往往不愿意分享。目前,国内CPATH所涉及的DL模型训练和研究的主要形式是一些CPATH开发公司与大型医疗机构以科研的名义进行合作,从而可以获得大量的患者队列及临床资料。