跳转到内容
← 返回研究方法
量化因果推断政治学方法11 分钟阅读

回归不连续设计:门槛两边为什么可以比较

Regression Discontinuity Design

奖学金只给考试分数达到 80 分的学生,补贴只给人口少于五万的地方,候选人得票超过 50% 才能当选。政策世界到处是门槛。回归不连续设计(Regression Discontinuity Design, RDD)利用门槛两侧待遇突然变化的规则,比较刚好在两边的单位。 直觉是:79.9 分与 80.1 分的学生通常很相似…

回归不连续政策门槛局部因果效应准实验因果推断

破除误解:门槛不会自动制造实验

奖学金只给考试分数达到 80 分的学生,补贴只给人口少于五万的地方,候选人得票超过 50% 才能当选。政策世界到处是门槛。回归不连续设计(Regression Discontinuity Design, RDD)利用门槛两侧待遇突然变化的规则,比较刚好在两边的单位。

直觉是:79.9 分与 80.1 分的学生通常很相似,却因规则获得不同待遇。若其他决定结果的因素在 80 分附近平滑变化,而结果在门槛处突然跳跃,这个跳跃可以归因于待遇。

但“存在分数线”并不自动等于自然实验。参与者能否精确操纵分数?门槛处是否同时改变了其他政策?分析是否为了得到显著结果反复选择带宽和曲线?RDD 的可信度来自一整套可审计假设,不来自图上画了一条竖线。

从奖学金研究开始

Donald Thistlethwaite 与 Donald Campbell 在 1960 年研究美国国家优异奖学金计划。他们比较资格考试分数刚好高于和低于门槛的学生,考察获奖认可对教育与职业态度的影响。这篇论文把“行政分配规则”转化为因果设计,后来成为 RDD 的经典起点。

设运行变量为 (X_i),门槛为 (c),处理状态为

Di=1(Xic).D_i=\mathbb{1}(X_i\ge c).

在门槛左右估计结果函数 (E[Yi|Xi=x])。锐断点设计中的局部处理效应为

τRD=limxcE[YiXi=x]limxcE[YiXi=x].\tau_{RD}=\lim_{x\downarrow c}E[Y_i|X_i=x]-\lim_{x\uparrow c}E[Y_i|X_i=x].

这里不是把所有高分者与低分者比较。远离门槛的人可能在能力、资源和目标上系统不同;识别只依赖无限接近门槛时的左右极限。

连续性假设说了什么

核心假设是:没有处理时,潜在结果在门槛附近连续。也就是说,决定结果的其他因素不会恰好在同一门槛突然跳变。学生能力可以随分数逐渐提高,地区治理能力可以随人口缓慢变化;只要它们没有在资格线处断裂,就不会制造同样的跳跃。

这个假设无法像普通零假设一样被直接证明,因为门槛一侧永远缺少另一种处理状态。但研究者能检查其含义:处理前变量是否在门槛处连续?门槛附近样本密度是否异常?换成理论上不受政策影响的安慰剂结局,是否也出现跳跃?在假门槛处重复分析,效果是否消失?

这些检查都不是护身符。协变量平衡不能排除所有未观测断裂,安慰剂不显著也可能只是统计能力不足。最终仍需制度知识解释门槛如何制定、数据如何记录、参与者知道什么。

锐断点与模糊断点

在锐断点设计中,跨过门槛会确定性改变处理:所有 80 分以上者获得奖学金,以下者都不获得。现实更常见的是模糊断点:达到门槛只会提高接受处理的概率。例如达到年龄线的人有资格申请福利,但有人不申请;线下的人也可能通过其他通道获得服务。

模糊 RDD 通常用跨越门槛对实际处理概率的跳跃,去缩放结果跳跃:

τFRD=结果在 c 处的跳跃处理概率在 c 处的跳跃.\tau_{FRD}=\frac{\text{结果在 }c\text{ 处的跳跃}}{\text{处理概率在 }c\text{ 处的跳跃}}.

这与工具变量思路相连,识别的是被资格规则改变处理状态者的局部平均效应,而不是所有人的平均效应。若资格几乎不改变实际参与,分母很小,估计会非常不稳定。

带宽与函数形式

越靠近门槛,左右单位越相似,偏差通常越小;但样本也越少,方差越大。带宽就是围绕门槛纳入多宽的数据范围。窄带宽更“局部”,却可能噪声很大;宽带宽更精确,却要求结果趋势在更远范围仍能被模型正确描述。

现代实践通常偏好门槛两侧的局部线性或低阶多项式,并使用数据驱动的带宽、偏差校正和稳健置信区间。把全样本套入高阶多项式可能在边界产生剧烈摆动,看似贴合数据,实际由少数点决定跳跃。

透明报告应展示原始分箱图、不同合理带宽、不同核权重和估计规范。若结论只在某个精心挑选的窗口出现,就需要解释那个窗口为何由制度而非结果决定。

操纵门槛:最危险的破口

RDD 依赖个体无法精确控制自己落在门槛哪一边。若官员可以把盟友的评分从 79.8 改成 80.0,企业可以调整申报人数以获得补贴,门槛附近两组就不再近似随机。密度检验会检查运行变量在门槛处是否出现异常堆积,但它只能发现某些形式的操纵。

“分数不能完全控制”与“分数完全随机”也不是一回事。考生可以努力影响成绩,却通常无法精确控制到小数点;这种不精确性可能保留局部比较。反之,即使密度平滑,负责评分的委员会也可能依据不可观测信息同时决定分数和待遇。

数据离散也会改变设计。年龄按整岁记录、选举票数是整数,小样本地区在门槛附近可能只有几个取值。此时连续极限近似较弱,应报告随机化推断、聚类结构或替代分析,而不是机械使用大样本公式。

局部效应不是全国答案

RDD 的强内部效度伴随窄外部效度。80 分附近学生的奖学金效应,不一定等于 95 分学生或 60 分学生的效应;人口五万附近地方的补贴效应,也不一定适用于百万人城市。政策制定者若要取消门槛或覆盖全部人群,需要额外理论、其他研究设计或多个门槛提供外推证据。

这不是缺陷,而是诚实的参数边界。一个可信的局部答案通常胜过一个用强假设换来的全国平均数。问题在于报告时必须把“门槛附近的局部效应”写进结论,而不能在摘要里悄悄升级成“该政策有效”。

例如评估基本收入或就业保障时,某个资格线附近的 RDD 可以回答边缘申请者获得收入或岗位后的变化,却不能回答全民无条件覆盖后的税收、工资和社会规范反馈。微观识别与制度总体效果之间仍需要模型和其他证据搭桥。

与双重差分怎样配合

RDD 利用同一时点门槛附近的横截面连续性,双重差分利用处理组与对照组随时间的平行趋势。若门槛政策在某年启动,研究者可以结合时间与门槛,检查断点是否只在政策后出现。这种组合能排除门槛处原有的固定断裂,却引入更多模型选择。

设计的选择应由制度决定。明确资格线且无法精确操纵时,RDD 很有力;分批实施且有可比趋势时,DiD 更自然;既没有门槛也没有趋势对照时,硬把连续变量切成两组不会创造识别。

常见误区

  • “门槛两边就是随机分组”:只有在不能精确操纵、其他决定因素连续时,门槛附近才具有类似随机化的性质。
  • “图上有跳跃就证明政策有效”:函数形式、分箱方式、带宽和同点其他政策都可能制造视觉跳跃。
  • “样本越多越好”:纳入远离门槛的样本会增加精度,也会增强函数形式假设;更多数据可能带来更多偏差。
  • “RDD 得到的是全体平均效应”:标准结果是门槛附近的局部效应,外推需要额外证据。

跨域连接

  • 政治实验与自然实验:RDD 把行政规则当成近似随机分配机制,但“自然”不等于无需设计论证。研究者必须说明为什么门槛附近单位可比、谁能操纵以及处理实际如何执行,这些制度事实相当于实验的随机化说明书。
  • 双重差分:DiD 依赖未处理趋势平行,RDD 依赖潜在结果在门槛连续。两者用不同反事实回答政策问题;若门槛与时间同时提供变异,可以互相验证,却不能用一个设计的漂亮图掩盖另一个设计的失败假设。
  • 因果推断与可信性革命:RDD 体现“设计先于回归”。估计式并不复杂,可信度来自分配规则、不可操纵性、局部窗口和预先说明的诊断。它说明计量技术的进步,本质上常是更认真地研究制度如何产生数据。
  • 证据与证明:法律资格线也会制造门槛两边的差别,但统计局部效应不能单独证明个案中的权利侵害。群体因果证据、制度文本与个体事实属于不同证明层级,必须说明如何连接。
  • 调查研究与公共舆论测量:民调发布与政策资格都可能按分数阈值分类。把连续态度切成“支持/反对”会丢失门槛附近的不确定性;RDD 则只有在阈值真正改变待遇时才获得因果含义,不能把任意分类线当处理。

参考文献

  • Thistlethwaite, Donald L., and Donald T. Campbell. “Regression-Discontinuity Analysis: An Alternative to the Ex Post Facto Experiment.” Journal of Educational Psychology 51, no. 6 (1960): 309–317. https://doi.org/10.1037/h0044319
  • Imbens, Guido W., and Thomas Lemieux. “Regression Discontinuity Designs: A Guide to Practice.” Journal of Econometrics 142, no. 2 (2008): 615–635. https://doi.org/10.1016/j.jeconom.2007.05.001
  • Lee, David S., and Thomas Lemieux. “Regression Discontinuity Designs in Economics.” Journal of Economic Literature 48, no. 2 (2010): 281–355. https://doi.org/10.1257/jel.48.2.281
  • McCrary, Justin. “Manipulation of the Running Variable in the Regression Discontinuity Design.” Journal of Econometrics 142, no. 2 (2008): 698–714. https://doi.org/10.1016/j.jeconom.2007.05.005