跳转到内容
← 返回研究方法
因果推断方法论10 分钟阅读

实验与准实验

Experiments and Quasi-experiments

实验不是自然科学的专利,社会学也不是只能观察不能干预。只要研究者能把人、组织、班级、社区或信息随机分配到不同条件,就可以用实验研究社会机制。问题不是社会能不能实验,而是什么问题适合实验,什么干预合乎伦理,实验结果能推广到哪里。 第二个误解,是把实验等同于“最科学”。随机分配确实能增强因果识别,但实验可能过于短期、场景人…

实验准实验因果推断随机分配政策评估

破除误解

实验不是自然科学的专利,社会学也不是只能观察不能干预。只要研究者能把人、组织、班级、社区或信息随机分配到不同条件,就可以用实验研究社会机制。问题不是社会能不能实验,而是什么问题适合实验,什么干预合乎伦理,实验结果能推广到哪里。

第二个误解,是把实验等同于“最科学”。随机分配确实能增强因果识别,但实验可能过于短期、场景人工、样本狭窄,甚至因为伦理限制无法研究最重要的问题。一个设计糟糕的实验不如一个设计精良的观察研究。

第三个误解,是以为准实验只是低配实验。准实验利用政策变化、制度阈值、自然冲击或时间差异来构造可比组。它没有完全随机分配,但如果设计严谨,仍能提供强有力的因果证据。

因果问题

实验和准实验的核心,是反事实。我们想知道某个处理是否改变结果:培训是否提高就业,信息提示是否改变投票,去污名化课程是否减少偏见,福利政策是否改善儿童健康。

难点在于同一个人不可能同时接受和不接受处理。随机分配通过让处理组和控制组在平均意义上可比,解决这个问题。若分配真随机,结果差异就可以更可信地归因于处理。

社会实验必须明确处理是什么。 “教育”太宽泛,无法实验;一套具体课程、一次信息提示、一项奖学金、一个面试回电条件、一个社区干预,才是可操作处理。

实验类型

实验室实验在控制环境中进行,适合研究机制。例如合作、信任、惩罚、歧视和规范遵从。它的优势是控制强,缺点是场景可能离现实较远。

田野实验在真实社会场景中进行。经典例子包括简历回电实验:研究者发送资历相同但姓名暗示族群或性别不同的简历,观察雇主回应差异。田野实验外部效度更强,但伦理和控制更复杂。

调查实验把随机处理嵌入问卷。研究者可以随机改变问题框架、候选人信息、政策描述或故事细节,观察态度变化。它成本较低,适合研究认知框架和偏见,但结果仍是回答,不一定等于真实行为。

组织和政策实验则在学校、社区、企业或政府项目中进行。它们最接近政策评估,但实施难度高,常涉及多层级随机化和长期追踪。

准实验设计

准实验利用现实世界中的“近似随机”变化。双重差分比较政策实施前后处理地区与未处理地区的变化差异。它要求处理组和对照组在没有政策时本应有相似趋势。

断点回归利用制度阈值。例如考试分数高于某线才能获得奖学金,阈值附近的人非常相似,刚过线和刚没过线的差异可以用来估计奖学金效果。

工具变量利用一个影响处理但不直接影响结果的外生因素。例如距离学校远近影响受教育机会,但是否能作为工具变量,要看它是否还通过家庭、地区和劳动力市场影响结果。工具变量强大,也最容易被误用。

自然实验利用不可由研究对象选择的冲击,例如抽签、政策分批、灾害边界、行政规则改变。关键是证明冲击足够外生,并且没有其他同时变化的因素解释结果。

内部效度

内部效度关注因果结论在研究内部是否可信。随机化是否成功?是否有人拒绝接受处理?处理组和控制组是否互相污染?是否有样本流失?结果测量是否一致?

样本流失尤其危险。若处理组中受影响最大的人更容易退出,结果会偏。研究者需要报告流失率,比较流失者特征,并做敏感性分析。

合规问题也常见。被分到培训组的人未必参加,被分到控制组的人可能自己寻找培训。研究者要区分意向治疗效应和实际接受处理的效应。

溢出效应也会破坏实验。若控制组通过同学、同事或邻居得到处理信息,两组差异会被稀释。若一个社区的干预改变了周边社区行为,简单比较处理地和对照地就会低估或误判效果。社会关系越密集,实验越需要考虑网络和空间外溢。

外部效度

外部效度关注结果能否推广。一次在大学生中进行的偏见实验,能否推广到职场招聘?一个城市的社区干预,能否推广到农村或其他国家?短期信息提示,能否产生长期态度改变?

实验结果常高度依赖场景。处理强度、机构能力、文化规范、资源基础和执行者都影响效果。社会学实验不能只报告“有效”或“无效”,还要说明在什么条件下有效。

多地点重复实验、异质性分析和机制测量可以改善外部效度。若同一机制在不同场景中反复出现,结论更可信。

伦理

社会实验的伦理比技术更难。研究者是否可以隐藏身份?是否可以给某些人资源、不给另一些人?是否可以制造歧视体验?是否可以观察真实雇主的行为而不告知?

伦理判断要考虑风险、知情同意、欺骗、补偿、公平和公共利益。某些审计实验需要一定程度的隐瞒,否则无法测量歧视,但研究者必须尽量降低对第三方的成本和伤害。

政策实验也有分配正义问题。若一个项目可能有益,为什么不给所有人?常见做法是等待名单、分阶段实施或在资源有限时随机分配。随机化不应成为剥夺权利的借口。

机制与异质性

知道一个项目有效还不够。社会学要问为什么有效,对谁有效,在什么条件下有效。培训提高就业,可能是技能提升,也可能是证书信号、社交网络扩展、求职信心增加或雇主偏见改变。

机制测量可以通过中介变量、访谈、田野观察和过程数据实现。异质性分析则比较不同群体效果,例如性别、阶层、地区、初始能力和组织环境差异。

如果只报告平均效果,可能掩盖不平等。一个政策平均有效,却只帮助原本资源较多的人,社会意义就完全不同。

机制研究还要避免把中介变量当作自动解释。若一次信息提示提高了投票率,可能因为知识增加,也可能因为被提醒、被规范压力触发,或因为研究者联系本身让人感到被观察。只有把行为记录、后续访谈和替代处理结合起来,才能更接近真正机制。

异质性也不是事后到处寻找显著差异。研究者应在理论上预先说明为什么某些群体效果可能不同,并谨慎处理多重比较。否则,实验会变成在噪声中寻找漂亮故事。

实验不能替代什么

实验擅长回答清楚处理的局部因果问题,却不擅长解释长时段结构变迁。我们很难随机分配阶级、国家制度、殖民历史、家庭出身或城市化路径。

实验也不能替代概念工作。若研究者没有清楚定义偏见、信任、污名、社会资本或组织文化,随机化只能产生看似精确但概念贫弱的结果。

因此,实验最好与理论、历史、统计和质性方法结合。它是因果工具箱中的一件强工具,不是全部工具箱。

跨域连接

  • 因果推断的可信性革命:经济学与社会学在同一时期走了不同的路——一个把重心放在识别策略(工具变量、断点、双重差分),一个更依赖实地实验。两者互补而非替代:当处理无法被分配时,识别的可信性成为质量标准;当可以分配时,随机化仍是最强的检验。
  • 越轨与社会控制:审计研究(配对简历、配对求租申请)是社会学最有力的实验工具——它能在真实市场中直接测量歧视,而不依赖被歧视者的自我报告或雇主的自陈。其伦理代价同样明确:被试无法知情同意,且研究本身占用了对方的时间与资源。
  • 可重复性危机与开放科学:实地实验的效应量普遍小于实验室,而这不是缩水而是信息:真实环境中存在实验室排除掉的竞争性影响。因此"实验室有效、现场无效"最常见的解释不是原发现是假的,而是效应被现实中的其他力量抵消了。
  • 生命伦理学:涉及公共政策的实地实验有一个特殊问题——对照组被有意排除在可能有益的干预之外,而受影响的是真实的福利。这使随机化的正当性依赖于"我们确实不知道它是否有效"这一前提,一旦证据已经充分,继续随机分配就不再正当。
  • 因果推断:实验与观察研究:政策变更、行政边界、抽签制度提供了"准随机"的分配,而每一种的可信度取决于一个可被质疑的假设:接受处理与否是否真的与结果无关。明确写出这一假设并说明为何可信,是评价准实验研究的第一步,而它在实务中常被一句"外生冲击"带过。

参考文献

  • Campbell, Donald T. and Stanley, Julian C. Experimental and Quasi-Experimental Designs for Research. Houghton Mifflin, 1963.
  • Shadish, William R., Cook, Thomas D., and Campbell, Donald T. Experimental and Quasi-Experimental Designs for Generalized Causal Inference. Houghton Mifflin, 2002.
  • Gerber, Alan S. and Green, Donald P. Field Experiments. W. W. Norton, 2012.
  • Angrist, Joshua D. and Pischke, Jorn-Steffen. Mostly Harmless Econometrics. Princeton University Press, 2009.
  • Pager, Devah. “The Mark of a Criminal Record.” American Journal of Sociology, 2003.

延伸阅读

  • Duflo, Esther, Glennerster, Rachel, and Kremer, Michael. “Using Randomization in Development Economics Research.” 2007.
  • Imbens, Guido W. and Rubin, Donald B. Causal Inference for Statistics, Social, and Biomedical Sciences. Cambridge University Press, 2015.