不是把许多论文平均一下
同一个心理干预,有的研究报告显著有效,有的没有发现差异,还有的发现效果只存在于特定人群。面对分散甚至冲突的结果,元分析试图把可比较的效应放到共同尺度上,估计总体模式及其不确定性。
但元分析不会自动把弱研究变成强证据。若检索漏掉负结果、研究测量不同构念、设计偏差相似,精确的合并数字只会把系统误差包装得更整齐。
因此,系统综述负责提出问题、检索、筛选、评价与解释;元分析是其中可选的统计综合工具。没有透明综述流程的“效应量汇总”,不能承担完整证据综合的任务。
先定义要综合的目标量
在选择效应量之前,应把目标估计量写成一句可审查的话:
在哪一类人群与情境中,把哪种干预或暴露改为哪种比较状态,在多长时间后,会使哪个结果按何种尺度平均改变多少?
这句话至少限定人群、处理、比较、结果、时间、实施策略和效应尺度。随机试验的意向治疗效应、依方案效应,观察研究中的暴露关联,以及中介或调节效应,不应因为都能转换成标准化均值差就被视为同一个目标量。
研究可以在统计上“可换算”,却在因果问题上不可合并。系统综述需要先判断各研究是否在估计足够接近的对象,再讨论数值转换。
从可回答的问题开始
好的综述先定义研究对象、干预或暴露、比较条件、结局、研究设计和情境。
“正念是否有效”过于宽泛。有效于谁、相对于等待名单还是主动治疗、改善短期自报压力还是长期临床复发,答案可能完全不同。
纳入标准应在检索前确定,并允许在有理由时修订和留痕。若看过研究结果后改变标准,筛选过程会悄悄偏向期待结论。
问题越宽,覆盖越广,但合并解释越困难;问题越窄,内部可比性越强,却可能只剩少量研究。范围选择是科学判断,不只是检索技术。
检索是一种测量
文献检索像用问卷测量“所有相关研究”。数据库、关键词、语言、年代和灰色文献来源决定了这把尺子的覆盖范围。
只检索英文期刊会漏掉地区研究,只搜标题会漏掉术语不同的论文,只依赖已发表文章会放大学术出版选择。
系统综述应保存完整检索式、数据库与日期,记录去重、筛选和排除理由。至少两名评审者独立筛选并解决分歧,可以减少单人判断漂移。
预印本、学位论文、试验注册和作者联系能补充未发表结果,但也带来版本、质量和重复计入问题,需要明确核对。
效应量是共同语言
不同研究可能使用不同量表和统计结果。元分析需要把它们转换为共同效应量。
连续结局常使用标准化均值差,二元结局可使用风险比或优势比,关联研究常转换相关系数。每种指标都有解释边界。
标准化效应依赖研究内标准差。如果某样本高度同质,标准差较小,同样原始差异会显得更大。优势比也常被误读为风险比,尤其当结局并不罕见。
效应方向、计算公式、前后测相关和小样本修正应预先规定。不能因为某种换算产生更漂亮结果才选择它。
尺度选择还会改变目标量。风险差、风险比和优势比在基线风险不同时并不保持同样的跨研究稳定性;末次测量差、变化量差和协变量调整后的差也依赖不同信息。若只能通过强假设换算,应把假设带入不确定性和敏感性分析,而不是把换算后的数字当作直接观测。
权重与精度
元分析通常让估计更精确的研究获得更高权重。大样本、误差较小的研究因此对合并结果影响更大。
权重高不等于偏差小。一个规模巨大的非随机研究可能非常精确地估计一个有偏关系。风险偏倚评价与统计精度必须分别处理。
也不能简单按“研究质量分数”给权重。把不同偏差维度加成总分会隐藏关键缺陷。更合理的做法是分领域判断,并在敏感性分析中排除高风险研究。
森林图应同时展示每项研究的效应与区间、权重、合并结果和异质性,让读者看到平均值背后的分布。
固定效应与随机效应
固定效应模型假设所有研究共享同一个真实效应,观察差异只来自抽样误差。其推断目标是这组研究的共同效应。
随机效应模型允许不同研究拥有不同真实效应,并估计这些效应的分布。心理研究的人群、任务和实施方式常不同,因此随机效应更常见。
但随机效应不是“异质性问题的一键修复”。它给小研究相对更多权重,研究数量少时研究间方差估计可能不稳定。
模型选择应由推断目标和研究生成过程决定,而不是看哪个产生显著结果。
异质性是要解释的现象
总体效应只是中心位置。若研究效应差异很大,平均值可能不适用于任何具体情境。
研究间方差描述绝对异质性,I² 描述观察变异中有多少不能归于抽样误差。I² 会受研究精度影响,不能用固定阈值机械判定“可否合并”。
预测区间更接近应用问题:未来一项相似研究的真实效应可能落在哪里。合并效应显著而预测区间跨过零,意味着平均有作用,但新情境中可能无效或反向。
异质性来源可包括年龄、文化、剂量、比较组、测量方式、实施忠实度和偏差风险。解释必须在理论上合理并尽量预先指定。
亚组分析与元回归
亚组分析比较不同研究特征下的效应,元回归把研究层特征作为预测变量。
它们常被误用为因果解释。若发现平均年龄较高的研究效果更大,并不能推出年龄导致效果增强,因为这些研究可能同时具有不同地区、剂量和设计。
研究数量少时,元回归容易过拟合;多个调节变量测试又会增加偶然发现。连续变量不应随意切成高低组。
调节结果应看组间差异或回归系数,而不是“一组显著、另一组不显著”。后者不等于两组显著不同。
依赖效应与多层元分析
一篇研究常报告多个结局、时间点或实验条件。这些效应来自同一批参与者,并不独立。
随意挑一个结果会引入选择,全部当独立结果会低估标准误。可使用多层元分析、稳健方差估计或预先定义的效应合成规则。
同一数据集还可能被多篇论文重复发表。综述必须识别共享样本,否则一个大型项目会被重复计权。
依赖结构处理方式应报告,并用不同相关假设做敏感性分析。
发表偏差与选择性报告
显著、方向符合预期的结果更容易发表;研究内部也可能只报告最有利的结局、模型或时间点。
漏斗图、回归检验和选择模型可以提供线索,但没有一种方法能从已发表结果中完美恢复缺失研究。小样本效应也可能来自真实情境差异,而不只是发表偏差。
“剪补法”不应被当作自动校正按钮。其假设常过于简单,校正数字可能给出虚假确定性。
最有力的防线是研究注册、注册报告、未发表数据检索和结果无关的纳入流程,而不是事后统计魔法。
把缺失证据看作数据生成过程
“没有进入元分析”可能发生在多个阶段:研究未启动、未完成、未注册、未发表,论文未报告目标结局,或报告格式无法提取。每一层都有不同的选择机制。
只对漏斗图不对称做一次统计检验,无法区分这些过程。更可审计的做法是:
- 将试验注册、方案、预印本与正式论文链接到同一研究;
- 记录已测量但未报告的结局和时间点;
- 联系作者并保存回复与数据版本;
- 比较注册结果、论文结果和可获得的数据;
- 对“缺失研究更小或方向更不利”等假设做边界分析;
- 将无法恢复的缺失明确计入证据确定性。
这相当于把发表偏差从一张图的问题,还原成一条可追踪的缺失数据链。
风险偏倚与证据确定性
研究风险偏倚应按设计检查。随机试验关注随机化、偏离干预、缺失结局、测量和选择性报告;观察研究还要关注混杂与选择过程。
风险偏倚不是论文写作质量。报告不清会使判断困难,但格式漂亮也不能消除设计缺陷。
证据确定性还取决于不一致、间接性、不精确和发表偏差。多个低偏倚、直接、结果一致的研究,比大量小而有偏的研究更可信。
综述结论应区分“平均估计是什么”和“我们对估计有多大把握”。
可复现的综合流程
高质量流程通常包括:
- 公开方案与主要分析计划;
- 保存可复跑的检索式和筛选记录;
- 双人独立提取关键数据;
- 对换算、缺失统计量和共享样本建立规则;
- 用代码生成效应量、模型与图表;
- 做偏倚、模型、异常研究和依赖结构的敏感性分析;
- 共享数据字典、分析代码与可许可的提取数据;
- 在更新时保留版本与变更记录。
PRISMA 流程图和清单帮助完整报告,但遵守清单不等于方法自动可靠。它是透明性的底线,不是质量认证。
活综述与累积证据
某些领域新研究增长很快,一次性综述很快过时。活系统综述定期更新检索、筛选和模型,并记录结论变化。
持续更新也带来多次检验、版本管理和资源负担。团队应预先规定更新频率、触发条件和停止规则。
累积元分析按时间观察证据如何发展,可以揭示某些结论早已稳定,后续小研究贡献有限;也可能显示早期夸大效应逐渐回落。
研究价值不只取决于是否再增加一项显著结果,而在于它能否减少关键不确定性、代表缺失人群或区分机制。
从研究集合外推到现实决策
随机效应模型估计的平均效应属于某个研究分布,不天然等于某个国家、诊所或个体的预期效果。若纳入研究主要来自高收入国家、短期实验和自选参与者,合并结果不能仅凭样本总量很大就推广到资源受限地区或长期常规服务。
应用前应比较研究集合与目标情境中的效应修饰因素,例如基线风险、年龄、文化、服务能力、比较组强度和实施忠实度。必要时可用目标人群分布进行标准化或加权,但目标情境超出研究支持范围时,模型不能创造证据。
预测区间回答“未来一项来自类似研究分布的研究可能怎样”,不等于“指定目标人群会怎样”。两者都需要清楚定义适用总体。
常见误区
研究数量多就证据强忽略了偏差可能系统同向。
异质性高就不能合并也过于简单。可以综合,但必须改变推断目标并解释分布。
总体显著就人人有效混淆平均效应、预测区间和个体反应。
元分析位于证据金字塔顶端容易把方法标签当质量。综述结论受纳入研究与综述流程共同限制。
纳入标准越宽越客观不成立。范围过宽可能把不同问题混成一个数字。
如何阅读一篇元分析
先看问题、方案和检索覆盖,而不是先看菱形是否跨零。
检查效应量是否可比、同一研究的多个结果如何处理、风险偏倚是否进入解释。
再看异质性与预测区间,判断平均值对具体情境是否有意义。
查看发表偏差方法是否被谨慎解释,调节分析是否预先指定且研究数量足够。
最后确认数据、代码和排除理由是否可审计,作者是否把低确定性结论写得过于肯定。
跨域连接
- 统计学:元分析的结论不能强于它汇总的文献,而当小样本阳性结果被优先发表时,汇总会放大而非平均掉偏倚。漏斗图、剪补法、p 曲线与选择模型都是为估计这一偏倚而设计的,它们的结果常常显著改变原始估计——这使"有元分析支持"这句话本身不构成证据强度的保证。
- 循证医学:证据等级把元分析放在顶端,而这一排序假定被汇总的研究本身可靠。心理治疗领域的一个具体污染源是研究者立场(allegiance):研究者偏好的疗法在其自己的试验中效应量系统性偏高。因此比较性结论必须报告并调整这一变量。
- 可重复性危机与开放科学:自我损耗是最具代表性的案例——早期元分析报告中等效应,校正发表偏倚后估计接近零,而多实验室预注册复制证实了后者。这一序列说明:元分析可以延长一个不存在的效应的寿命,因为它的可信外观来自汇总而非来自数据质量。
- 因果推断的可信性革命:异质性是元分析最容易被草率处理的部分——当效应在不同人群与情境中方向不同时,平均值是没有对应物的数字。因此近年的实践重心从"合并出一个数"转向估计效应在什么条件下成立,这与识别策略的思路一致。
- 机器学习概览:单个研究的样本被汇总以提高精度,而这一逻辑与集成方法有形式上的相似:多个弱估计的组合可以优于任何单个估计。关键的差别在于独立性:集成方法要求误差不相关,而同一领域的研究共享方法、样本与理论倾向,因而"更多研究"未必带来更多独立信息。
方法的核心判断
元分析的目标不是制造一个最终数字,而是建立可审计的证据地图:
已知结果的中心在哪里,差异有多大,哪些设计更可信,哪些人群缺席,以及什么新研究最能减少不确定性?
当这些问题被清楚回答时,综合才让证据累积;否则,更多小数位只会掩盖知识边界。
参考文献
- Page, M. J., et al. (2021). The PRISMA 2020 statement. BMJ, 372, n71.
- Borenstein, M., Hedges, L. V., Higgins, J. P. T., & Rothstein, H. R. (2009). Introduction to Meta-Analysis. Wiley.
- Higgins, J. P. T., et al. (Eds.). (2024). Cochrane Handbook for Systematic Reviews of Interventions. Cochrane.
- Hedges, L. V., Tipton, E., & Johnson, M. C. (2010). Robust variance estimation in meta-regression. Research Synthesis Methods, 1(1), 39-65.
- Stanley, T. D., Carter, E. C., & Doucouliagos, H. (2018). What meta-analyses reveal about the replicability of psychological research. Psychological Bulletin, 144(12), 1325-1346.
- Mathur, M. B., & VanderWeele, T. J. (2020). Sensitivity analysis for publication bias in meta-analyses. Journal of the Royal Statistical Society: Series C, 69(5), 1091-1119.
- Tipton, E. (2014). How generalizable is your experiment? An index for comparing experimental samples and populations. Journal of Educational and Behavioral Statistics, 39(6), 478-501.
延伸阅读
- Harrer, M., Cuijpers, P., Furukawa, T. A., & Ebert, D. D. (2021). Doing Meta-Analysis with R. Chapman & Hall/CRC.
- Gurevitch, J., et al. (2018). Meta-analysis and the science of research synthesis. Nature, 555, 175-182.
- Nakagawa, S., et al. (2023). Methods for testing publication bias in ecological and evolutionary meta-analyses. Methods in Ecology and Evolution, 14, 4-21.