跳转到内容
← 返回核心概念
方法论11 分钟阅读

循证医学

Evidence-Based Medicine

1747 年在英国军舰索尔兹伯里号上,海军军医 James Lind 把 12 名患坏血病的水手两两分成 6 组,在饮食相同的前提下分别给予柑橘、苹果酒、醋、海水等不同疗法,结果唯独吃柑橘那一组的两人迅速好转。 这常被称为历史上第一个有对照的临床试验。严格说,它有"对照"却还没有"随机分组",但"在相同条件下比较不同处…

循证医学随机对照试验系统综述证据等级临床试验

1747 年在英国军舰索尔兹伯里号上,海军军医 James Lind 把 12 名患坏血病的水手两两分成 6 组,在饮食相同的前提下分别给予柑橘、苹果酒、醋、海水等不同疗法,结果唯独吃柑橘那一组的两人迅速好转。

这常被称为历史上第一个有对照的临床试验。严格说,它有"对照"却还没有"随机分组",但"在相同条件下比较不同处理"这一核心思想,已经诞生。

然而又过了将近两百年,医学才真正学会一件事:一个治疗有没有用,不能靠权威、经验或直觉来断定,要靠系统的证据。

这个听起来像常识的原则,直到二十世纪后期才被命名、奠基为"循证医学"。它的出现,本身就是医学史上一次安静的革命。

破除误解:循证医学不是"否定医生经验"

最常见的误解是把循证医学理解为"只信数据、不信医生",甚至"机器治病"。这恰恰相反。

循证医学的奠基人之一 David Sackett 给出的经典定义,是三者的结合:最佳外部证据 + 医生的临床经验 + 患者的价值观与意愿

它从不主张抛弃经验,而是反对仅凭经验与权威下结论。

一位资深医生的直觉很宝贵,但人的记忆会偏向印象深刻的个案,会忽略那些沉默的失败案例。

循证医学要做的,是给经验装上一道"防自欺"的校验。

另一个误解是"没有 RCT 就不算证据"。

其实证据是分等级、可加权的。缺乏高级别证据时,低级别证据加专家共识仍是合理依据,只是结论的确定性更低。

还有人误以为循证医学只关心"有没有效"。

事实上它同样在意"对谁、在什么条件下、以多大代价有效"——一种疗法对人群平均有效,不代表对每个具体患者都是最优选择。

机制:从经验到证据的工具箱

循证医学的核心,是一套评估"我们对某结论到底有多确定"的方法。

它的工具按可信度由低到高排列,构成一个清晰的层级。

随机对照试验(RCT)是检验"疗法是否有效"的金标准。它的精髓在两点:

  • 随机分组:把受试者随机分到治疗组与对照组。随机化的威力在于,它能让已知和未知的干扰因素(混杂)在两组间大致均衡,从而把真正的疗效从背景噪声里分离出来——这正是观察性研究做不到的。
  • 盲法与安慰剂对照:受试者(单盲)乃至研究者与评估者(双盲)都不知道谁在哪组,以排除心理暗示(安慰剂效应)和评估偏倚。

对照组常给安慰剂,正是因为人即使吃的是"假药",也常常真觉得好转——不设对照,就分不清疗效里有多少其实是安慰剂效应。

但单个 RCT 仍可能因样本小、运气、或研究质量而误导。于是有了更高一级的工具:

  • 系统综述(systematic review):按预设、可复现的规则,穷尽检索某问题的所有合格研究,评估其质量与偏倚风险,综合得出结论。
  • 荟萃分析(meta-analysis):用统计方法把多项研究的数据合并,提高精度。Cochrane 协作组织(1993 年成立)是系统综述的全球标杆。

由此形成一座证据等级金字塔,确定性由低到高大致是:

专家意见与个案报告 → 病例对照与队列研究(见 epidemiology)→ 随机对照试验 → 系统综述与荟萃分析。

但要强调,金字塔不是死板的等级表。

现代体系(如 GRADE)更强调评估证据的总体确定性:一项设计粗糙的 RCT,未必比一项严谨的大型队列研究更可信。研究类型只是起点,质量才是关键。

为什么重要:它推翻过许多"想当然有效"的疗法

循证医学不是纸上谈兵,它一次次纠正了医学的错误。

经典案例是激素替代疗法(HRT)。

基于观察性研究,医学界一度普遍认为它能保护绝经后女性的心血管。

直到 2002 年大型 RCT(Women's Health Initiative)发现,雌激素加孕激素方案反而增加心血管事件与乳腺癌风险,整个临床实践被彻底改写。

但这个案例还有第二层、更微妙的教训,正好展示循证医学如何自我修正:WHI 受试者平均年龄约 63 岁,远晚于绝经年龄。后续再分析提出"时间窗假说"——对在绝经前后较早开始用药的女性(50–59 岁),获益与风险的天平可能不同。所以正确的结论不是简单的"激素替代有害",而是"对谁、何时开始、用哪种方案"才是关键。把一个 RCT 的群体结论生硬地推广到所有人,同样会出错。

另一个更刺眼的案例是抗心律失常药的 CAST 试验。

医生本以为压制心梗后患者的早搏能救命,符合直觉(早搏与猝死相关,压住它似乎天经地义);1989 年公布的 RCT 却显示,用药组(恩卡尼、氟卡尼)的死亡率是安慰剂组的约 2–3 倍,试验因此被提前中止。一个"机制上完全说得通"的疗法,实际上在杀人。

这些都说明同一件事:不做严格试验,"听起来合理"的疗法很可能正在害人。CAST 至今是医学院里讲"为什么需要 RCT"时最常被引用的反面教材。

正因如此,新药与新疗法在上市前必须经过分期临床试验,疫苗(见 vaccination)的有效性与安全性也是用大型 RCT 确立的。

循证医学还重塑了医生与患者的关系。

当证据被透明地呈现,患者就能参与到"获益有多大、风险有多大、值不值得"的讨论里,而不再只是被动接受医嘱。

从这个意义上说,循证医学不仅是方法论,也悄悄推动了医疗决策从家长式走向共同决策(见 informed-consent)。本文为科普,不替代专业医疗意见。

局限与争议

循证医学是医学方法论的巨大进步,但远非万能,争议持续。

  • 证据存在系统性偏倚:阳性结果更容易发表(发表偏倚),企业资助的试验更可能得出有利于其产品的结论,许多试验从不公开失败数据(催生了 AllTrials 等要求登记所有试验的运动)。
  • "对平均病人有效"≠"对你有效":RCT 给出的是群体平均效应,个体差异、合并症、老人儿童孕妇常被排除在试验之外。
  • 不是所有问题都能做 RCT:让人随机暴露于有害因素既不可行也不伦理(见 informed-consent),这时只能依赖观察性证据。
  • 被滥用为"教条"或托词:"缺乏证据"有时被错读成"证据表明无效"——证据不足只意味着不确定,二者天差地别。也有人批评循证医学被异化为忽视个体与临床判断的机械"按指南行事"。
  • 可重复性危机:近年大量研究无法被重复,部分原因是统计方法被滥用(如 p 值操纵、事后挑选有利结果)。这提醒人们,"有一项研究证明"远不等于"已被确立",单项结果须经独立重复与系统综述检验。

跨域连接

  • 顺势疗法的证据:证据等级不能脱离先验概率使用。当一种疗法的作用机制与已知化学、物理直接冲突时,一批小规模阳性试验提供的更新量抵不过它极低的起点;真正的检验是看随偏倚风险下降、样本增大,效应量是否稳定——顺势疗法的元分析里它趋近于零。这条推理同样适用于任何"机制不明但试验阳性"的新疗法。
  • 元分析与证据综合:把元分析放在金字塔顶端有个前提:被汇总的研究是随机样本。当小样本阳性结果更容易发表时,汇总会放大而不是平均掉偏倚,漏斗图不对称、剪补法与选择模型都是为估计这一项而设计的。可操作的推论是——"有元分析支持"本身不构成证据强度,必须看纳入研究的偏倚风险与检索是否穷尽。
  • 科学哲学:证据等级本质上是把归纳的可靠性操作化。GRADE 的做法是先按设计给定起点,再依偏倚风险、不一致性、间接性、不精确与发表偏倚逐级降级,也允许剂量-反应关系与大效应升级。这承认了一件事:没有哪种设计天然可靠,一项做砸的随机试验可以低于一项设计良好的队列研究。
  • 机会成本:指南常把"有效"与"值得"混为一谈。在固定预算下,采纳一项边际获益微小的高价疗法,代价是被挤出的其他服务本可产生的健康——这个代价以健康而非金钱计量,却几乎从不出现在疗效论文里。所以卫生技术评估要设阈值:不是给生命定价,而是承认不设阈值等于默许一次看不见的分配。
  • 信息检索与搜索:系统综述的结论上限由检索式决定。漏检的研究不会在森林图上留下任何痕迹,因此召回率不足造成的偏倚无法在后续分析中被发现或校正。这就是为什么规范要求逐库报告完整检索策略与检索日期:它是这类研究里唯一可被复现的部分,也是判断"全面"二字是否成立的唯一凭据。

参考文献

  • Sackett, D. L. et al. "Evidence based medicine: what it is and what it isn't." BMJ, 312, 1996. DOI: 10.1136/bmj.312.7023.71
  • Guyatt, G. et al. "GRADE: an emerging consensus on rating quality of evidence and strength of recommendations." BMJ, 336, 2008. DOI: 10.1136/bmj.39489.470347.AD
  • Writing Group for the Women's Health Initiative Investigators. "Risks and Benefits of Estrogen Plus Progestin in Healthy Postmenopausal Women." JAMA, 288, 2002. DOI: 10.1001/jama.288.3.321
  • Higgins, J. P. T. et al. (eds.) Cochrane Handbook for Systematic Reviews of Interventions, Cochrane / Wiley, 2nd ed., 2019.
  • Echt, D. S. et al. "Mortality and Morbidity in Patients Receiving Encainide, Flecainide, or Placebo — The Cardiac Arrhythmia Suppression Trial (CAST)." New England Journal of Medicine, 324, 781–788, 1991. DOI: 10.1056/NEJM199103213241201
  • Lind, J. A Treatise of the Scurvy, Edinburgh, 1753(1747 年 HMS Salisbury 上的对照试验).

延伸阅读

  • Goldacre, B. Bad Science, Fourth Estate, 2008.