证据的分级与推荐

二、证据的分级与推荐

(一)证据的分级

由于不同的研究结果其真实性和可推广应用性不同,即证据强度不同,临床医生在使用证据以及研究人员在研究和制定临床实践指南的过程中,就需要对证据进行评价和分级,以便能够正确、合理地使用证据。

证据分级是指应用临床流行病学原则和方法以及有关质量评价的标准,评价证据的真实可靠性与临床应用价值。证据得到科学合理的评价和分级后,有助于让临床工作者结合自身经验判断文献是否可以提供可信的临床指导,同时有利于临床工作者在遵循同一标准的基础上进行有效的临床医学讨论。循证医学问世以来,其证据分级先后经历了“老五级”“新五级”“新九级”和“GRADE”等几个阶段。

1.“老五级”证据分级

“老五级”证据分级是按临床研究设计将所有临床试验证据分为五级,系统评价/Meta分析结果、大样本多中心随机对照试验级别最高,设计良好的队列研究或具有重大意义的非队列研究居中,专家意见级别最低(见表10-4)。由于这种分级太宏观,并且没有考虑临床研究类型的不同,只能应用于干预治疗类型的临床试验文献,对实践的指导意义有限。

表10-4 “老五级”证据分级

图示

2.“新五级”证据分级

“新五级”证据分级是2001年5月牛津循证医学中心(Oxford Centre for Evidence Based Medicine,OCEBM)制定的证据水平评价标准。它是基于科研设计的角度,根据研究类型分别制定了详细的分级,涉及治疗、预防、病因、危害、预后、诊断、经济学分析等7个方面。表10-5把治疗类型的临床证据分为5级,并细化为10个水平。“新五级”证据分级依据包括研究设计、研究结果评价和临床适用性等方面。在Ⅰ级证据中除传统的RCT、Meta分析外,还首次纳入了“全或无”证据,即无对照的研究证据。所谓“全”即在引入干预措施之前,所有患者均能够预测会发生某一结局,而采用该干预措施之后,有部分患者不会发生该结局事件;所谓“无”是指在引入干预措施之前,部分患者会发生某一结局,而引入干预措施之后,所有的患者均不发生该结局事件。在表10-5中,越靠上的证据设计越严谨,偏差越小,证据力越强;越靠下的就显得设计薄弱,偏差大,证据力弱。该体系分级详细,针对性强,且较客观,不同评价者对证据分级的认同一致性高,已成为循证医学教学和循证临床实践中公认的经典标准。但该分级体系过于复杂和深奥,初学者不易掌握。

表10-5 牛津循证医学中心的“新五级”证据分级

图示

续表

图示

3.“新九级”证据分级

2001年,美国纽约州立大学医学中心(Medical Center of State University of New York)提出证据金字塔(the evidence pyramid),即“新九级”证据分级(见图10-1),首次将动物研究和体外研究纳入证据分级系统,跟国际上生物医学发表文章的趋势相一致。“新九级”证据呈金字塔形按等级排列,位于塔顶的证据级别最高,位于塔基的实验室研究级别最低、可靠性最差。“新九级”证据分级拓展了证据范畴,具有简洁、直观的优点。(https://www.daowen.com)

图示

图10-1 “新九级”证据分级金字塔

4.GRADE证据分级

前三种证据分级标准较关注设计质量,对过程质量监控和转化的需求方面重视不够。针对前几种标准内容复杂、应用局限、标准各异的不足,包括世界卫生组织在内的19个国家和国际组织的67名指南制定者、系统综述作者和临床流行病学专家共同参与成立的推荐、评估、发展和评价分级工作组(The Grading of Recommendations Assessment,Development and Evaluation Working Group,GRADE Working Group),于2004年推出了一套证据质量分级和推荐意见评级系统,简称GRADE证据分级(见表10-6)。GRADE分级体系避免了过去主要从研究设计角度评价证据质量的现象,综合考虑了研究设计、研究质量、研究结果的一致性和证据的直接性,依据未来研究对目前疗效评价结果可信度的影响大小,将证据分为高、中等、低和极低4个等级,其推荐强度简化为强、弱2级。该体系强调证据对临床应用的影响,提高了判断利弊的透明度,确保对健康获益的判断过程透明,且简明易用、适用范围广,目前已被世界卫生组织、Cochrane协作网等国际组织所采纳。

表10-6 GRADE证据分级

图示

医学文献的证据分级标准多种多样、繁简不一、各有特点,在应用中应根据临床问题进行选择,选择时一般推荐:GRADE证据分级>“新九级”证据分级>“新五级”证据分级>“老五级”证据分级。

(二)证据的推荐建议

除证据分级体系外,在临床实践指南和其他著述中,还有所谓的推荐评价体系,通过衡量医疗行为的风险与获益,以及该操作基于何种证据等级来对医疗行为及医患沟通做出指导。比较有影响的是基于“新五级”和GRADE的推荐建议。

1.基于“新五级”的推荐建议

牛津循证医学中心对“新五级”各类级别证据,根据证据质量、一致性、临床意义、普遍性、适用性等将推荐建议分为A(优秀)、B(良好)、C(满意)、D(差)4级。其中,A级推荐意见来自结果一致的一级临床研究结论,临床意义大,证据研究的样本人群与目标人群吻合,因此该推荐建议可直接应用于各医疗行为中;而B、C级推荐建议则在上述各方面存在一定问题,其适用性受到不同限制;D级推荐建议无法应用于医疗行为。

2.基于GRADE的推荐建议

GRADE的推荐建议强度只分为“强”“弱”两级。使用GRADE证据分级时,指南制定小组用“强推荐”表示他们确信相关的干预措施利大于弊,用“弱推荐”表示干预措施有可能利大于弊,但他们把握不大。GRADE的两级推荐强度为患者、临床医生和政策制定者提供了明确的指引。强推荐的含义是:对患者,在这种情况下,多数患者会采纳推荐方案,只有少数不会,此时若未予推荐,则应说明;对临床医生,强推荐应该是多数患者接受的方案;对政策制定者,该方案在大多数情况下会被采纳作为政策。弱推荐的含义是:对患者来说,大多数患者会采纳推荐方案,但仍有不少患者不采用;对临床医生而言,应认识到不同患者有各自适合的方案,医生得帮助每个患者做出体现其价值观和意愿的决定;对政策制定者,制定相关政策需要实质性讨论,并需要众多利益相关者参与。

GRADE关注转化质量,从证据分级出发,整合了分类、分级和转化标准,它代表了当前对研究证据进行分类分级的国际最高水平。该系统简明易用、适用范围广,可用于各医学专业和临床护理的临床推荐意见的制定。尽管目前许多循证医学资源系统支持该分级及推荐系统,但在不支持该系统的数据资源中,还需借鉴“老五级”“新五级”“新九级”等分级与推荐系统的标准判断证据质量及其可靠性。

值得注意的是,证据等级水平虽与推荐级别直接相关,但并不一定完全反映和决定推荐级别。证据的利弊权衡、证据质量高低、价值观和意愿、资源利用等都会直接影响推荐强度。一般而言,证据利弊间差别越大,越适合做出强推荐;证据质量越高,推荐强度相应也越高;价值观和意愿差异越大,处理措施的成本越高,则越不适合做出强推荐。