验证过程及步骤
(一)扫描仪及浏览器校准试验(需供应商及IT技术人员协助)
(1)查验扫描仪出厂及批准文件,确保设备是有关监管部门批准的合格产品。同时确认扫描仪安装正确,处于备用状态。
(2)最佳扫描参数测定:取一张制作优良的HE切片(推荐含有淋巴组织的切片,最好是带被膜的脾脏、扁桃体或胸腺组织)进行扫描,观察WSI图像的色度、对比度、清晰度、聚焦平面、扫描完整性及伪影炫光等,直到调整到最佳状态为止,并记录最佳状态参数。
(3)扫描速度及失败率初测:选取不同大小、不同组织类型和不同部位的10张优良HE切片,在最佳状态参数下扫描,记录扫描开始和结束时间,算出每张切片的平均扫描时间,同时检查WSI图像质量,计算扫描失败率。
(4)扫描仪连续工作性能测定:随机选取用于常规诊断的优良HE切片满负荷加载(扫描仪一次性连续扫描的最大切片数量,比如100张)进行自动扫描,重复扫描3次,每次换用不同的常规切片。分别记录每次扫描的平均扫描时间和失败率,再计算三次扫描总和后的平均扫描时间和失败率。
(5)浏览器(电脑、移动设备及显示屏)校准:在自然光照或常规办公照明充分的环境中(避免光线直接照射),对浏览器显示屏的角度、分辨率、色彩饱和度、亮度等进行调整,直到最佳观看状态。
(6)网络连接:检查入户网络连接的网线类型,确保达到终端站点超五类或六类、虚拟病理科/实验室六类或超六类质量合格的网线要求,确认达到从集线器到电脑或服务器在100 m内的距离要求。
(二)参与验证的病理医师培训
凡是参与远程病理系统验证的病理医师必须参加验证前培训过程,以确保验证过程和结果的客观性和准确性。
1.培训内容
(1)WSI及远程阅片系统的使用流程及注意事项:具体的切片扫描过程,图像格式和视觉效果,浏览界面样式和软件功能及图像质量的判断等。
(2)至少完成60例以上的不同器官系统具有代表性的HE染色的数字图像学习,目的是熟练掌握屏幕阅片的操作流程及软件功能设置,适应屏幕视野的展现方式和重新建立细胞放大倍数在脑内的大小参数。建议阅读75例(当然,越多越好)HE染色的数字图像为宜,包括各种活检标本50例及各种手术切除标本25例,每天15例连续5天完成,以保持适当的记忆强化效果。
(3)至少15张以上不同抗体不同表达模式(包膜、胞核及胞质各5张)的IHC染色的数字图像观察学习。建议30张为宜,包膜、胞核及胞质各10张,同时应包含不同阳性强度表达的数字图像,在3天之内完成为宜。
(4)关于荧光染色图像的学习,建议至少阅读5张FISH荧光染色的数字图像并进行结果判读,最常见的标本为乳腺癌或肺腺癌。
2.验证方法(https://www.daowen.com)
以往文献显示,远程病理系统和WSI图像的验证方法多种多样,验证环境和条件各异,有些也很不规范。自2013年CAP关于WSI临床应用的验证指南发布后,各地对远程病理系统和WSI图像的验证逐步规范,形成了一些比较成熟的验证方法,概括起来主要包括HE染色与数字图像一致性验证,冰冻切片与数字图像一致性验证,非劣效性或等效性验证和前瞻性验证等。前面两种方法比较简单直接,便于理解和操作,但易受干扰、存在一定的偶然性。非劣效性或等效性验证不是直接比较两种模式之间的诊断符合率,而是对两种模式下各自诊断正确率的比较,所以方法相对科学,结果更具有说服力。前瞻性验证是指远程/数字病理诊断正式运行前,在日常的诊断工作中随机选取一定数量的病例扫描后用数字图像进行诊断,然后再用传统光镜去证实结果的可靠性,如果数字图像结果正确就直接发出报告,如果数字图像结果与传统光镜诊断不符,则以光镜结果为准。某种意义上,前瞻性验证属于数字图像诊断的试验性运行,因此验证结果更符合真实的工作环境。
(1)常规组织切片与数字图像(包括IHC)一致性验证:常规HE病例数≥100例,病例要随机选择,具有代表性,能够反映不同的组织类型及难易程度。实践中,各种病例的活检标本如内镜、宫颈宫腔、粗针穿刺及皮肤活检等应该占到样本总数的40%左右,手术切除标本占60%。切除标本的组织类型也可以按细胞形态特点选择,如上皮样细胞、梭形细胞、小圆细胞及透明样细胞等,可能更利于通过细胞形态对数字图像质量的评估。建议以WSI图像与光镜之间的诊断一致性≥97%为可接受的最低标准。需要特别注意的一个现象就是,在不一致的病例中,WSI图像结果有时会比传统光镜诊断更符合实际。常规IHC病例≥20例,至少要包含10种不同抗体,着色部位应该包含典型的胞膜、胞质及胞核。
(2)冰冻切片与数字图像的一致性验证:选择一定数量的以往诊断过的冰冻切片进行扫描,病例数应≥60例,比较WSI图像与光镜之间的诊断一致性。如果参与验证的病理医师与以前冰冻诊断报告为同一个人,则无须再重新在传统光镜下阅读原来的切片,如果为不同的人,则应按照验证要求分别阅读以前的冰冻切片和由此产生的数字图像并比较两者的诊断一致性。除诊断一致性外,还需验证比较两种模式下的诊断时间(TAT),以便考察WSI图像对冰冻诊断时间的影响。
(3)非劣效性或等效性验证:在临床试验中,主要研究目的是显示试验药物或方法(记为T)的综合效果在临床意义上不差于(非劣于)对照药物或方法(记为C)的试验称为非劣效性试验(non-inferiority trails)。在临床实践中,非劣效性试验用来验证在事先确定的一个具有临床意义的效果差值范围内,试验药物或方法是否劣于对照药物或方法。这个事先确定的具有临床意义的效果差值称为非劣效性界值(non-inferiority margin),记为δ。
非劣效性界值δ是一个具有临床意义的值,在判定两种药物或方法非劣效时,是临床上可以接受的最大值。因此,如何确定δ值的大小对非劣效性试验结果至关重要。δ值太大,则可能将实际效果比对照药物或方法差很多的药物或方法引入临床应用;相反,若δ值太小,则可能将确实有效的药物或方法判为无效而排除在临床应用之外。一般来说,δ值的确定由临床专家和统计学专家共同选定比较合适,同时还应考虑临床意义、统计学意义和成本效益等多方面因素。关于两组率(有效率、治愈率、符合率、阳性率等)的比较,有文献指出[21,22]δ值最大不超过对照组样本率的1/5,并建议取15%以下。个人认为δ值的确定要根据不同的专业特点、临床经验及大多数主流文献的数据等综合判断具体研究项目的δ值的大小。非劣效性检验的基本原理见图1.10,常见检验假设类型见表1.3。

图1.10 非劣效性检验原理示意图
表1.3 非劣效性试验不同类型的检验假设

注:表中数式的具体意义及结论可以解释为:●非劣效性检验,如P>0.025,按单侧α=0.025的检验水准不能拒绝H0假设,即无法判断T药物/方法不差于C药物/方法;如P≤0.025,则接受H1假设,可以认为T药物/方法不差于C药物/方法。●等效性试验的假设检验是:如P1>0.025或P2>0.025,按2α=0.05的检验水准不能拒绝H0假设,即无法判断T药物/方法等效于C药物/方法;如P1≤0.025且P2≤0.025,则接受H1假设,可以认为T药物/方法等效于C药物/方法。
这种验证方法不是直接比较两种模式诊断的一致性,而是分别计算两种模式诊断的准确率并进行比较,然后得出WSI图像诊断的效能并不比传统光镜差或者说两者的诊断效能是一样的。目前,很少有已发表的研究报告证实了外科病理学中真正的观察者内的差异,关于WSI图像和传统光镜之间诊断差异的非劣效性界值并无明确定论,有研究估计可能在3%~4%[23]。所以,建议在两种诊断模式的非劣效性验证中,通常情况下非劣效性界值可以设定为3%或4%,单侧二项分布式检验,显著性水平为α=0.05,置信区间(confidence interval,CI)为90%。如果非劣效性界值设定为3%或4%,则相对应的样本量最少为单侧225例,双侧450例以上[23]。
关于诊断准确率,对入组的验证病例的诊断最好由几位病理医师协商得出一个共识意见作为参照,然后由参与验证的人员分别阅读HE切片和WSI图像并与共识意见比对得出各自诊断模式的准确率。同时,在按验证设计步骤完成验证过程后,对这两种模式取得的诊断准确率(或差异率)数据进行统计学处理时,可以交由专业统计学专家处理。
2013年,克利夫兰诊所的Bauer博士等[23]根据对以往文献的分析统计结果提出了以下假设:如果WSI图像诊断的主要差异与传统光镜检查相比不超过4%,则WSI图像诊断的效能就不比传统光镜检查差。换句话说,如果WSI图像诊断的准确率与传统光镜的准确率差异≤4%,则两种模式是等效的。而要满足4%的差异率(非劣效性界值),则需要验证的样本含量至少应在450例以上(单侧二项分布检验,单侧225例)。这个假设是否成立,还需要进行非劣效性验证。
根据上述假设,Bauer博士等[23]对总共607例(单侧分别为303例和304例)不同器官种类的标本进行了验证总结。结果显示,两种模式的主要不一致率为WSI 1.65%,传统光镜0.99%,两者间的差异率为0.66%,90%可信区间为(-0.86,2.19),P<0.001;次要不一致率为WSI 2.31%,传统光镜4.93%,两者间的差异率为-2.62%,90%可信区间为(-5.11,-0.14),P<0.001。表明这种验证方法不仅可行,而且4%的差异率设定是合理的。
(4)前瞻性验证:通常在系统一致性验证后进行,相当于远程病理诊断正式实施前的试验性诊断。主要目的是测试系统运行的顺畅性和稳定性,进一步优化工作流程,提高远程病理医师对数字图像诊断的熟练性。建议每周25例,持续4周共100例日常送检的连续常规病例(包括IHC或FISH染色)。先由一名病理医师用WSI系统作出诊断,随后再由另一名病理医师用常规光镜进行诊断。两种诊断模式的结果进行比较(两名医师不知道彼此的结果),如果WSI的结果与光镜一致,数字报告正常发出;如果WSI的结果与光镜不一致,数字病理报告则按光镜诊断结果(须经过第三者复核)进行修改后发出。验证结束后对两种模式的诊断差异及验证过程中发现的问题进行总结分析,并根据验证结果进行整改、完善和优化。前瞻性验证不是必需的,但我们建议进行此项验证。