相关不是因果,但随机实验也不是魔法
青少年使用社交媒体的时间越长,抑郁得分越高。这可能表示社交媒体增加心理风险,也可能是情绪低落者更常转向线上互动,或家庭压力同时影响两者。
一句“相关不等于因果”能指出问题,却不能告诉我们怎样前进。因果推断的任务是把问题写得足够明确:
- 改变哪一种暴露或干预;
- 与什么替代状态比较;
- 对谁、在什么时间范围内;
- 关注哪个结果;
- 需要哪些设计与假设才能把观察差异解释为因果效应。
随机实验能让一部分假设更可信,但失访、不依从、干预扩散、测量误差和样本选择仍会破坏解释。观察研究也不是天然无效;它需要更明确地说明因果结构和无法由数据直接检验的识别假设。
先定义估计对象
“治疗是否有效”不是一个完整问题。假设每个人都有两个潜在结果:
- \(Y(1)\):接受干预时的结果;
- \(Y(0)\):未接受干预时的结果。
个体因果效应是 \(Y(1)-Y(0)\),但同一个人在同一时刻不能同时处于两个条件,这就是因果推断的基本缺失数据问题。
研究通常估计群体层面的量:
- 平均处理效应(ATE):目标人群中平均会改变多少;
- 已处理者平均效应(ATT):已经接受干预的人平均获益多少;
- 条件平均效应(CATE):某类特征人群中的平均效应;
- 意向治疗效应(ITT):被分配到干预策略,而不论是否完全遵从,带来多少改变;
- 依方案效应:按特定遵从方式接受干预时的效果,需要额外假设。
这些量可能数值不同。临床医生关心“眼前患者在可执行方案下会怎样”,政策制定者关心“向整个符合条件人群提供项目会怎样”,两者不应共享一个含糊的“总体效果”。
识别与估计是两件事
识别问:如果拥有无限数据,现有设计与假设是否足以把目标因果量写成可观察数据的函数?
估计问:在有限样本中,用什么模型和算法计算这个量及其不确定性?
复杂机器学习可以改善预测和函数拟合,却不能自动修复未测混杂。反过来,一个识别清楚的问题也可能因样本太小、重叠不足或模型不稳定而无法精确估计。
一份可信分析应分别写出:
- 目标试验或因果问题;
- 识别假设;
- 估计方法;
- 诊断与敏感性分析;
- 对目标人群的外推边界。
随机实验建立了什么
随机分配使处理组与对照组在重复抽样意义上可交换,已测和未测的基线因素不再系统决定分组。它为因果识别提供了强基础,但不保证一次样本中所有变量恰好平衡,也不保证后续过程无偏。
意向治疗是默认起点
按最初随机分组比较结果,可以保留随机化建立的可交换性。参与者未完全使用干预时,ITT 估计的是“提供或分配这一策略”的效果,不是理想遵从下的生物或心理效应。
只比较实际完成治疗者与未完成者,会重新引入选择:能坚持治疗的人可能同时拥有更多资源、更低症状或更强动机。
随机化之后仍可能出错
- 差异失访:干预组与对照组退出原因不同;
- 不依从:分组与实际接受的处理不一致;
- 干预扩散:对照组接触到干预内容;
- 测量受分组影响:知道自己接受治疗改变了自报或评分;
- 结果选择:只报告最有利的时间点或量表;
- 小样本偶然失衡:重要预后因素在本次试验中分布不同。
因此,随机化是设计属性,不是论文整体无偏的认证标志。
三项核心识别条件
在潜在结果框架下,常见识别论证需要审查三类条件。
一致性
一个人的观察结果应对应其实际接受处理下的潜在结果。但“接受心理治疗”可能包含不同剂量、治疗师、技术与实施忠实度。处理定义过于宽泛时,一致性难以成立。
可交换性
给定一组协变量后,处理分配不再与潜在结果相关。随机实验通过设计支持这一点;观察研究则需要相信所有关键共同原因已经被正确测量和调整。
可交换性通常不能只靠数据证明。领域知识、因果图、负对照和敏感性分析用于评估它有多可信。
正值性
每类目标人群都应有非零概率接受各比较条件。如果严重患者几乎必然接受治疗,数据中就缺少与其可比的未治疗者。
正值性不足会产生极端权重和模型外推。增加样本量不能创造从未出现的比较。
因果图:决定该控制什么
有向无环图(DAG)用节点表示变量,用箭头表示假定的直接因果关系。它的价值不是把相关图画得漂亮,而是暴露分析者对数据生成过程的承诺。
混杂因素
家庭压力同时影响社交媒体使用与抑郁,是暴露和结果的共同原因。若测量充分,调整它有助于阻断后门路径。
中介变量
睡眠可能位于“夜间社交媒体使用 → 睡眠减少 → 抑郁症状”的路径上。若目标是总效应,直接控制睡眠会删去一部分真实效应;若目标是直接效应,则需要更强的中介分析假设。
碰撞变量
心理求助可能同时由社交媒体问题与抑郁症状导致。只研究已经求助的人,相当于条件化一个共同结果,可能制造原本不存在的关联。
“把所有可用变量都放进回归”因此不是稳健策略。控制变量必须由因果问题和图结构决定。
观察研究的主要工具
标准化、匹配与加权
结果回归估计不同协变量水平下的结果,再标准化到目标人群。匹配寻找协变量相近的处理与对照个体。逆概率加权构造一个处理分配与已测协变量较少相关的伪总体。
这些方法只能处理已测且正确表示的混杂。倾向得分平衡的是协变量分布,不是结果,也不是未测因素。
双重稳健方法结合处理模型与结果模型:在一组常规条件下,两者有一个正确即可获得一致估计。但“有一个正确”仍是强要求,不能理解成任意两个错误模型互相保险。
自然实验与准实验
回归不连续设计利用阈值附近个体的近似可比性,估计阈值附近的局部效应。它依赖分配变量不能被精确操纵、阈值附近其他因素连续等条件。
差分中的差分比较处理组和对照组在事件前后的变化差。核心不是两组水平相同,而是若无干预,它们会保持可比的趋势。事件前趋势只能提供部分诊断,不能证明反事实平行趋势。
工具变量使用一个影响处理、但只通过处理影响结果的外生来源。相关性、排除限制与单调性等假设决定估计对象;弱工具会导致严重不稳定。
这些设计通常识别局部、特定制度条件下的效应。内部识别更强,不代表可以直接推广到所有人。
纵向数据与时间变化混杂
重复测量不自动带来因果识别。既往症状可能影响后续暴露,暴露又影响下一期症状;一个变量既是前期处理的结果,又是后期处理与结果的混杂因素。
普通回归若直接控制这类时间变化变量,可能阻断部分处理路径或引入偏差。边际结构模型、g 公式和结构嵌套模型等 g 方法,专门处理这种处理—混杂反馈,但依然依赖一致性、可交换性、正值性和正确测量。
固定效应模型可以控制个体内不随时间变化的稳定因素,却不能消除随时间变化的未测混杂,也不能自动解决反向因果。
中介、调节与异质效应
发现干预改变中介、且中介与结果相关,并不足以证明机制。中介—结果关系可能有未测混杂,中介测量误差也会扭曲直接与间接效应。
“A 组显著、B 组不显著”不等于组间效应不同。调节需要直接检验交互或异质效应,并预先说明理论、尺度与多重比较。
机器学习可以寻找 CATE,但数据驱动发现的亚组很容易过拟合。应使用样本分割、交叉拟合、外部验证,并报告目标人群中各亚组的支持范围。
从研究样本到目标人群
内部效度回答“这项研究中的比较是否可信”,外部效度回答“目标人群在目标实施条件下会怎样”。
试验参与者可能更健康、更有时间、更愿意遵从;治疗师和机构也可能比常规服务拥有更多资源。即使试验内部无偏,样本平均效应也未必等于社区推广效果。
外推需要定义目标人群,比较试验样本与目标人群中效应修饰因素的分布,并在必要时进行标准化或抽样权重调整。若目标人群在关键特征上超出试验支持范围,诚实结论应是证据不足,而不是依赖模型远距离外推。
测量决定因果变量是什么
如果暴露、结果或混杂因素测错,因果图中的节点就不再对应分析数据中的变量。
- 两组对症状题目的理解不同,会把测量不等值误作处理效应;
- 只用总屏幕时间,会混合主动交流、被动浏览、学习和夜间使用;
- 用治疗结束者自报满意度,会同时受到选择与测量过程影响;
- 数据缺失取决于未观察结果时,常规完整案例分析可能有偏。
因果推断不能替代心理测量。构念定义、测量等值、缺失机制与数据质量是识别论证的一部分。
诊断和敏感性分析
模型拟合好不等于因果假设成立。更有价值的检查包括:
- 处理组与比较组的协变量重叠和权重分布;
- 不同合理模型与协变量表示下的结果稳定性;
- 负对照暴露、负对照结果或安慰剂时间点;
- 对未测混杂强度的定量敏感性分析;
- 对失访、测量误差和处理定义的敏感性分析;
- 预先指定分析与探索性分析的明确区分。
敏感性分析不是寻找一个仍然显著的模型,而是说明需要多强的假设违背,才会实质改变结论。
一份可审计的因果报告
读者至少应能找到:
- 目标人群、处理、比较、结果与时间范围;
- 目标估计量及其尺度;
- 因果图或等价的结构假设;
- 纳入和未纳入变量的理由;
- 识别条件与可能违反方式;
- 估计方法、区间与诊断;
- 缺失、失访和测量误差处理;
- 未测混杂与模型选择敏感性;
- 从研究样本外推到目标场景的限制。
因果推断的专业性,不在于使用了多复杂的算法,而在于把反事实问题、证据和不可检验假设放到同一张桌面上。
跨域连接
- 因果推断的可信性革命:经济学与心理学面对同一问题却发展出不同的答案——心理学依靠随机化,经济学在无法随机化时发展了识别策略(工具变量、断点回归、双重差分)。两条路径的互补之处很实际:当实验不可行或外部效度存疑时,识别的可信性成为替代的质量标准。
- 流行病学:混杂、选择偏倚与中介的形式化处理最早在流行病学中成熟,而因果图(DAG)提供的关键能力是判断"控制哪些变量"——它明确指出控制中介或对撞因子会制造偏倚,这与"控制越多越干净"的直觉正好相反。
- 统计学:潜在结果框架把因果效应定义为同一单位在两种处理下结果之差,而其中至少一个永远观察不到。把因果推断表述为缺失数据问题,是这一领域最有生产力的一步:它使假设(可忽略性、一致性)变得可以被逐条陈述与讨论。
- 机器学习概览:预测与因果的区别在应用中反复被混淆——一个高准确率的预测模型可能完全依赖非因果的相关,因而在干预下失效。这一区分对政策工具尤其关键:能预测谁会失败,不等于知道改变什么能减少失败。
- 可重复性危机与开放科学:随机化保证的是内部效度,而复制困难的很大一部分来自外部效度与效应异质性——同一个操纵在不同人群与情境中效应大小不同甚至方向不同。这提示复制失败未必是原研究错误,而可能是效应本身有条件,但要区分两者需要事先声明的调节变量。
参考文献
- Hernán, M. A., & Robins, J. M. (2020). Causal Inference: What If. Chapman & Hall/CRC.
- Imbens, G. W., & Rubin, D. B. (2015). Causal Inference for Statistics, Social, and Biomedical Sciences. Cambridge University Press.
- Pearl, J. (2009). Causality (2nd ed.). Cambridge University Press.
- Shadish, W. R., Cook, T. D., & Campbell, D. T. (2002). Experimental and Quasi-Experimental Designs for Generalized Causal Inference. Houghton Mifflin.
- Rohrer, J. M. (2018). Thinking clearly about correlations and causation: Graphical causal models for observational data. Advances in Methods and Practices in Psychological Science, 1(1), 27-42.
- Grosz, M. P., Rohrer, J. M., & Thoemmes, F. (2020). The taboo against explicit causal inference in nonexperimental psychology. Perspectives on Psychological Science, 15(5), 1243-1255.
延伸阅读
- Hernán, M. A., Sauer, B. C., Hernández-Díaz, S., Platt, R., & Shrier, I. (2016). Specifying a target trial prevents immortal time bias and other self-inflicted injuries in observational analyses. Journal of Clinical Epidemiology, 79, 70-75.
- VanderWeele, T. J. (2015). Explanation in Causal Inference. Oxford University Press.
- Lundberg, I., Johnson, R., & Stewart, B. M. (2021). What is your estimand? Defining the target quantity connects statistical evidence to theory. American Sociological Review, 86(3), 532-565.