一种新药在细胞里有效,在小鼠身上有效,在早期患者中看起来也有效。
但它真的能让更多人活得更久、更好、更安全么?
医学不能只靠“看起来有希望”。临床试验(clinical trial) 是把治疗承诺放进可检验制度的方式:预先定义问题、分组、终点、统计方法和伦理保护,然后让数据回答。
破除误解:临床试验不是“拿病人做实验”
真正合格的临床试验不是随意尝试,而是受伦理、统计和监管约束的研究。
它必须说明:
- 为什么已有证据不足;
- 受试者会承担什么风险;
- 谁有资格参加;
- 如何分组;
- 主要终点是什么;
- 数据如何分析;
- 不良事件如何报告;
- 受试者如何随时退出。
这就是 知情同意 与 临床试验伦理 的核心:研究者不能把患者当作工具,必须让风险、利益和不确定性透明化。
随机化:抵抗偏差的发明
临床医学里最大的敌人之一是偏差。
病情轻的人更可能选择某疗法,富裕患者更可能接受新技术,医生也可能把“看起来更有希望”的患者安排到实验组。
随机化 的目的,是让已知和未知混杂因素在两组之间尽量均衡。它不能让个体结果可预测,却能让群体比较更可信。
随机对照试验(RCT)因此成为循证医学中评估疗效的核心工具。
盲法与安慰剂
如果患者知道自己用了新药,主观症状可能改善;如果医生知道患者在实验组,也可能更积极寻找改善证据。
盲法 试图切断这种期待效应。
- 单盲:受试者不知道分组。
- 双盲:受试者和研究者都不知道分组。
- 三盲:数据分析者也不知道分组。
安慰剂 并不是“假治疗”那么简单。它提供一个对照,让研究者区分药物本身效果、疾病自然波动、照护接触和心理期待。
在肿瘤、急症、重症等场景中,安慰剂必须满足伦理要求:不能让患者失去已有标准治疗。
试验分期
药物临床开发通常分期:
I 期:主要评估安全性、剂量范围和药代动力学,常为几十人。
II 期:初步评估疗效和剂量,通常数十到数百人。
III 期:大规模比较疗效和安全性,决定是否足以支持上市。
IV 期:上市后监测真实世界安全性、罕见不良反应和长期效果。
这不是机械阶梯。罕见病、肿瘤、疫苗、医疗器械、公共卫生干预都有变体。但分期思路反映了同一原则:先控制风险,再扩大证据。
终点:你到底测量什么
临床试验必须定义主要终点。
有些终点是硬终点:死亡、心梗、住院、卒中。
有些是替代终点:血压、肿瘤缩小、病毒载量、HbA1c。
替代终点能让试验更快、更小、更便宜,但风险是:指标改善不一定等于患者真正获益。
抗心律失常药物曾经能减少室性早搏这个替代指标,却在部分患者中增加死亡风险。这类教训让医学更警惕“好看的数字”。
样本量与中期监测
临床试验在开始前要估算样本量。样本太小,可能看不出真实疗效;样本过大,又会让更多患者暴露于不确定风险和资源浪费。
样本量通常取决于预期效应大小、主要终点发生率、显著性水平、统计功效和失访率。这里的关键不是“人越多越科学”,而是样本量必须与问题匹配。
大型试验还常设立独立数据安全监察委员会(DSMB)。如果中期数据显示疗效极强、伤害明显或试验已不可能得到有意义答案,委员会可以建议提前停止。
这体现了临床试验的伦理张力:研究需要足够数据,患者又不能被当作无限等待证据的工具。
适应性试验与平台试验
传统试验像固定路线:设计、入组、随访、分析,流程尽量不变。
但在肿瘤、罕见病和疫情中,固定路线有时太慢。适应性试验 允许在预先规定规则下调整随机比例、样本量或研究臂;平台试验 可以在同一主协议下持续加入或退出多个治疗方案。
COVID-19 期间,RECOVERY 等平台试验快速评估多个治疗策略,显示地塞米松能降低需要氧疗或机械通气患者的死亡风险,同时也排除了许多无效治疗。
这种设计的力量在于效率,但前提是统计规则、数据监测和透明报告足够严格。适应性不是“边做边改主意”,而是把可调整规则提前写进方案。
CONSORT:报告也需要标准
试验做得好,不代表报告就可信。研究者可能选择性报告终点、淡化失访、隐藏随机化方法不清的问题。
CONSORT 2010 声明为平行组随机试验提供报告清单,要求清楚呈现试验设计、随机化、盲法、样本量、参与者流程、结局和不良事件。
它的重要性在于:科学论文不是宣传稿,而是让别人能判断偏倚风险的证据文件。
局限与争议
临床试验不是完美答案。
外部效度:严格入组标准让结果更干净,却可能排除老年人、多病共存者、孕妇和少数族群。真实世界患者比试验人群复杂。
统计显著不等于临床重要:一个 p 值很小的差异,可能对患者生活没有意义;一个样本量小但效果大的发现,也可能值得严肃关注。
商业利益:赞助者、发表偏倚和选择性终点会影响证据生态。注册试验、公开方案和数据共享,是抵抗这些偏差的制度设计。
罕见病与紧急疫情:当患者少、时间紧、伦理压力大,传统大规模 RCT 可能不可行。适应性试验、平台试验和真实世界证据因此越来越重要。
患者真正关心的结果
临床试验过去常以影像、化验或医生评分为中心。现在越来越强调患者报告结局(PRO):疼痛、疲劳、睡眠、功能、情绪、生活质量。
这些指标更难测量,也更容易受盲法、文化和语言影响;但如果试验只证明肿瘤缩小、血糖下降,却不问患者是否能走路、睡觉、工作、照顾家人,证据就不完整。
医学的最终目标不是让表格更漂亮,而是让人活得更久、更少痛苦、更有功能。临床试验的终点设计,必须把这件事写进方法学。
真实世界证据能替代随机试验吗
电子病历、医保数据库和登记系统让研究者能观察数百万真实患者。这些数据能发现罕见不良反应,也能评估试验之外的人群。
但真实世界数据通常不是随机分配治疗。谁接受某药、谁没有接受,往往与年龄、收入、病情严重程度、医生偏好和医院资源有关。统计方法可以调整混杂,却很难证明所有关键混杂都已测量。
因此真实世界证据更适合补充 RCT,而不是简单替代 RCT。最强的医学证据生态,是随机试验回答因果问题,真实世界研究回答可推广性、安全性和长期效果。
负结果同样重要
临床试验的社会价值不只来自“成功上市”的药物。一个设计良好的阴性试验,也能阻止无效或有害疗法继续消耗患者希望、医保资金和医生时间。
问题在于,阴性结果更不容易发表,企业和研究者也缺乏宣传动力。试验注册、方案公开、结果数据库和系统综述,都是为了解决这种发表偏倚。
医学进步不是只靠发现有效治疗,也靠诚实排除无效治疗。
跨域连接
- 临床试验伦理:随机化在伦理上成立的前提是均势——专业共同体对哪一组更好尚无共识。这不是修辞,它决定了试验的起止:均势建立时才可以开始,均势被打破时必须停止,这正是数据安全监察委员会与提前终止规则的依据。反过来说,一项"结论已经很明显"的试验,伦理上已经不该继续招募。
- 统计学:随机化的作用常被说成"让两组基线一致",这并不准确。它保证的是分组独立于全部潜在结果,因而组间差值的期望等于因果效应;小样本下协变量照样可能不平衡。这条区分有直接后果:基线表出现差异不构成"随机化失败",而事后挑着基线差异去做调整,反倒会重新引入偏倚。
- 因果推断的可信性革命:经济学从临床试验借走了随机化,也带回一个反向提醒——试验估计的往往是依从者身上的局部效应,不是人群平均效应。当入组标准严格、依从率高于真实世界时,效应量向上偏。所以外推需要显式的模型,而不是默认"试验里有效,门诊也有效"。
- 预注册与注册报告:结果选择性报告的解药是事先声明主要终点,而这条机制留下了可测的痕迹:在 2000 年 ClinicalTrials.gov 启用前后,大型 NHLBI 心血管试验中主要终点显示获益的比例,从 30 项里的 17 项(57%)降到 25 项里的 2 项(8%)。心理学后来的预注册运动,走的是同一条路。
- 实验与准实验:把随机化搬到社会现场,会碰到医学里少见的障碍:个体不独立。疫苗、教育、转移支付都会外溢到未处理者身上,违反"一个人的结果不受他人分组影响"这条隐含假设。应对办法是把随机化单位提到群组(整群随机),代价是有效样本量骤降——这也是疫苗的群体效应试验规模远大于同等药物试验的原因。
本文为科普,不替代专业医疗意见。
参考文献
- Schulz, K. F., Altman, D. G. & Moher, D. "CONSORT 2010 Statement: updated guidelines for reporting parallel group randomised trials." BMJ, 340, 2010. doi:10.1136/bmj.c332
- Friedman, L. M., Furberg, C. D., DeMets, D. L., Reboussin, D. M. & Granger, C. B. Fundamentals of Clinical Trials. 5th ed., Springer, 2015.
- World Medical Association. Declaration of Helsinki: Ethical Principles for Medical Research Involving Human Subjects. 2013.
- FDA. Clinical Trials: What Patients Need to Know.(临床试验阶段与受试者说明)
延伸阅读
- Bothwell, L. E. et al. "Assessing the Gold Standard — Lessons from the History of RCTs." New England Journal of Medicine, 374, 2016. doi:10.1056/NEJMms1604593
- EQUATOR Network. CONSORT reporting guidelines.(临床试验报告规范资源)