跳转到内容
← 返回研究方法
量化方法方法论11 分钟阅读

统计模型

Statistical Modeling

统计模型不是把数据放进软件后等它给出真相,也不是在表格里找到显著星号就宣布发现。它是一种把理论问题、数据结构和不确定性连接起来的推理工具。模型的作用不是替研究者思考,而是迫使研究者明确:比较的是谁和谁,控制了什么,遗漏了什么,误差来自哪里,结论能推广到哪里。 第二个误解,是以为统计模型越复杂越高级。复杂模型可以处理复杂…

统计模型回归因果推断不确定性分层模型

破除误解

统计模型不是把数据放进软件后等它给出真相,也不是在表格里找到显著星号就宣布发现。它是一种把理论问题、数据结构和不确定性连接起来的推理工具。模型的作用不是替研究者思考,而是迫使研究者明确:比较的是谁和谁,控制了什么,遗漏了什么,误差来自哪里,结论能推广到哪里。

第二个误解,是以为统计模型越复杂越高级。复杂模型可以处理复杂结构,但也可能掩盖脆弱假设。一个清楚的交叉表、一张分组趋势图、一个简单回归,有时比堆叠变量的模型更能说明问题。

第三个误解,是把相关当因果。社会学模型常能显示教育、收入、性别、地区和健康之间存在关联,但关联本身不能说明原因。统计模型必须和研究设计、理论机制、时间顺序和替代解释一起使用。

模型从问题开始

统计模型首先服务研究问题。研究者要问:我要描述分布,解释差异,预测结果,还是识别因果?不同目标需要不同模型。

描述性模型关注社会状态。例如不同收入组的住房负担率、不同年龄群的孤独感、不同地区的教育机会。解释性模型关注变量之间的关系,例如家庭背景如何与大学入学机会相关。预测模型关注未来或未知个体,例如哪些学生更可能辍学。因果模型则问如果某条件改变,结果是否会改变。

这四种目标不能混淆。一个预测很准的模型未必解释机制,一个解释清楚的模型未必适合预测,一个相关模型未必能识别因果。

变量与操作化

统计模型中的变量不是自然落下来的,它们是操作化的结果。阶层可以用收入、职业、教育、资产或主观认同测量;社会资本可以用朋友数量、可求助资源、组织参与或网络位置测量。不同操作化会得到不同结论。

研究者必须说明变量为何能代表概念。若用收入代表阶层,就可能忽视资产和职业声望。若用学历代表教育,就可能忽视学校质量、专业差异和家庭文化资本。若用点赞数代表支持,就可能忽视讽刺、围观和算法推荐。

变量选择还涉及伦理。把族群、性别、地区、户籍或家庭背景放进模型,可能揭示不平等,也可能被误用于标签化。模型不是中立物,它会改变人们理解群体的方式。

回归的基本逻辑

回归模型试图估计在其他条件相同的情况下,一个变量与结果变量之间的关系。例如在控制家庭背景、性别和地区后,教育年限是否仍与收入相关。

“控制变量”不是魔法。只有当控制变量被正确测量、理论上合适,并且没有引入新的偏差时,它才有帮助。控制过多可能把真正的机制控制掉,控制过少可能留下混杂。

回归系数需要放回社会意义中解释。一个系数显著不代表影响重要。样本很大时,小到几乎没有现实意义的差异也可能显著。研究者应报告效应大小、置信区间和实质意义。

分类结果与计数结果

社会学数据常不是连续变量。是否就业、是否迁移、是否投票、是否进入大学,是二元结果;职业类别、居住类型、家庭形态,是多分类结果;抗议次数、犯罪次数、发帖数量,是计数结果。

这些结果需要合适模型。二元结果常用逻辑回归,多分类结果可用多项模型,计数结果可用泊松或负二项模型。模型选择不是形式问题,因为不同模型对误差和分布有不同假设。

但模型名字不应遮蔽解释。读者真正需要知道的是:哪些群体概率更高?差异有多大?不确定性如何?结果是否稳健?

分层与嵌套

社会数据常有嵌套结构:学生嵌套在班级和学校中,居民嵌套在社区中,工人嵌套在企业中,国家年份嵌套在国家中。普通回归若忽略这种结构,可能低估不确定性。

分层模型可以同时估计个体层和群体层因素。例如学生成绩既受家庭背景影响,也受学校资源影响;病人健康既受个人行为影响,也受社区医疗可及性影响。分层模型让研究者看到不同层级如何共同作用。

分层视角也提醒我们:社会结果不是纯个人属性。一个人的机会常受学校、社区、城市、制度和历史位置共同塑造。

缺失数据与测量误差

社会数据很少完整。高收入者可能拒绝报告收入,流动人口可能难以追踪,受污名群体可能隐瞒经历,平台数据可能删除账号。缺失不是随机噪声,常与研究主题本身相关。

直接删除缺失样本可能制造偏差。插补方法可以帮助,但它依赖假设。研究者应报告缺失比例、缺失机制的可能性和敏感性分析。

测量误差同样重要。自报收入、回忆中的工作时长、问卷中的歧视经历、平台记录的互动次数,都可能偏离真实概念。模型越精确,越不能忘记数据来源的粗糙。

显著性与不确定性

p 值不是研究质量的证明。它只是在某些假设下衡量数据与零假设的相容程度。它不能告诉我们效应是否大,理论是否对,样本是否代表总体,模型是否正确。

社会学更应重视不确定性。置信区间、预测区间、稳健性检验、替代模型和敏感性分析,能让结论更诚实。好的量化研究不是把不确定性藏起来,而是让读者知道结论在哪些条件下成立。

显著星号容易制造二分思维:显著就是有,非显著就是没有。现实更复杂。一个估计不精确的结果可能仍值得关注,一个显著但很小的结果可能没有实质意义。

因果推断的边界

统计模型可以帮助因果推断,但不能单独保证因果。因果推断需要明确反事实:如果同一个人没有接受某教育、没有迁移、没有失业,结果会怎样?现实中我们不能同时观察同一个人的两个状态,只能通过设计寻找可比对象。

随机实验、自然实验、断点回归、双重差分、工具变量和匹配方法,都是为了构造更可信的比较。统计模型在其中承担估计和不确定性表达,但核心仍是研究设计。

如果数据来自横截面调查,模型再复杂也很难解决时间顺序和遗漏变量。研究者应诚实说明限制。

可解释性与模型责任

当模型用于政策和平台治理时,后果会更重。风险评分、福利资格预测、学生辍学预警、警务部署、招聘筛选和内容推荐,都可能影响真实人生。社会学需要追问模型如何分类人,分类后谁受益,谁受损,谁能申诉。

可解释性不仅是技术问题,也是制度问题。一个模型即使数学上可解释,若受影响者无法知道自己为何被拒绝,仍然缺乏公共正当性。统计模型必须进入伦理和治理讨论。

与质性方法结合

统计模型可以发现模式,质性方法可以解释机制。模型显示低收入家庭学生更难进入名校,访谈可以解释志愿填报、信息不对称、教师期待和家庭风险规避。模型显示平台劳动者事故风险与接单密度相关,民族志可以观察他们如何在算法压力下抢时间。

混合方法不是把两种证据并排,而是让它们互相提出问题。统计结果中的异常案例,常是田野和访谈的入口;田野发现的机制,也可以转化为模型假设。

跨域连接

  • 因果推断的可信性革命:回归系数被解读为因果效应,是社会科学中最普遍的越界。控制变量不等于识别——控制中介或对撞因子反而制造偏倚。因果图的价值正在于它把"该控制什么"从直觉变成了可推导的问题,而这一步在多数发表的回归表中并未被交代。
  • 机器学习概览:预测与解释是两个不同目标,而它们对模型的要求相反:预测容许高维、黑箱与共线,解释要求参数可识别、有意义。用预测精度评价一个解释性模型,或用系数解释一个预测模型,是两个方向相反的常见错误。
  • 纵向与多层模型:社会数据几乎总是嵌套的(学生在班级、员工在企业、个体在地区),而忽略嵌套会低估标准误、夸大显著性。这是文献中一类可被系统追溯的错误来源,且其后果不是随机的:它总是让结论看起来比实际更确定。
  • 社会网络分析:标准回归假定观测独立,而网络数据的本质就是观测之间相互依赖。这使普通回归在网络数据上失效,并催生了专门的模型族(ERGM、SAOM)——这一案例说明方法的适用性由数据的生成结构决定,而非由变量类型决定。
  • 可重复性危机与开放科学:社会科学的分析自由度比实验心理学更大——变量构造、样本限定、控制集选择都有大量合理选项。规格曲线分析(报告全部合理规格的结果分布而非挑一个)是对此最直接的回应,也使"结论对分析选择有多敏感"成为可报告的量。

参考文献

  • Morgan, Stephen L. and Winship, Christopher. Counterfactuals and Causal Inference. Cambridge University Press, 2007.
  • Gelman, Andrew and Hill, Jennifer. Data Analysis Using Regression and Multilevel/Hierarchical Models. Cambridge University Press, 2007.
  • Agresti, Alan. An Introduction to Categorical Data Analysis. Wiley, 1996.
  • Angrist, Joshua D. and Pischke, Jorn-Steffen. Mostly Harmless Econometrics. Princeton University Press, 2009.
  • Long, J. Scott and Freese, Jeremy. Regression Models for Categorical Dependent Variables Using Stata. Stata Press, 2014.

延伸阅读

  • Pearl, Judea, Glymour, Madelyn, and Jewell, Nicholas P. Causal Inference in Statistics. Wiley, 2016.
  • Freedman, David A. Statistical Models: Theory and Practice. Cambridge University Press, 2005.