跳转到内容
← 返回现代研究方法
量化方法心理学方法13 分钟阅读

纵向研究与多层模型

Longitudinal Research and Multilevel Models

横断面研究像在同一天给许多人拍照,纵向研究则像持续拍摄同一批人的影片。 如果年长者比年轻者更谨慎,横断面数据不能告诉我们这是年龄增长带来的变化,还是不同世代成长环境造成的差异。要研究学习、衰老、治疗、关系和情绪调节,必须观察同一个体如何随时间改变。

纵向研究多层模型发展轨迹个体内变化密集测量

心理学真正关心的是变化

横断面研究像在同一天给许多人拍照,纵向研究则像持续拍摄同一批人的影片。

如果年长者比年轻者更谨慎,横断面数据不能告诉我们这是年龄增长带来的变化,还是不同世代成长环境造成的差异。要研究学习、衰老、治疗、关系和情绪调节,必须观察同一个体如何随时间改变。

纵向数据的价值也带来结构性难题:同一个人的多次观测彼此相关,人又嵌套在家庭、学校、治疗师或国家中。普通回归把每条记录当作独立个体,会低估不确定性,也会混淆“人和人不同”与“同一个人在变化”。

多层模型提供了一种语言,把这些层次同时写进分析。

三种时间尺度

纵向问题首先要说明时间尺度。

长期发展关注数月到数十年的轨迹,例如儿童执行功能、人格成熟或认知老化。

事件过程关注一个转折前后的变化,例如失业、迁移、创伤、治疗或政策实施。

密集动态关注小时或天尺度,例如压力如何在当天影响睡眠,社交互动如何改变下一时刻情绪。

同一个心理过程在不同尺度上可能方向相反。长期更有社交支持的人通常更幸福,但某个人在比自己平常社交更多的一天,未必立刻更幸福。把尺度混在一起会制造错误机制。

个体间差异与个体内变化

假设数据表明,经常运动的人抑郁程度较低。这是个体间关系:不同人之间的平均运动量与平均抑郁水平相关。

但真正的干预问题往往是:同一个人今天比自己平常多运动,之后是否更少抑郁?这是个体内关系

两者不能自动互推。收入较高的人可能整体压力较低,但一个人收入短期增加时,工作负担也可能上升。心理学若想解释过程,就必须把人的稳定差异与人的时变偏离分开。

常用做法是对时变预测变量进行个体均值中心化:一个变量拆成“这个人通常处于什么水平”和“这次相对自己的通常水平偏离多少”。模型因此能同时估计两个问题。

随机截距与随机斜率

多层模型最直观的形式是让每个人拥有自己的起点和变化速度。

随机截距表示个体具有不同的基线。例如治疗开始时,不同患者的症状严重度不同。

随机斜率表示时间或刺激的作用因人而异。例如平均而言治疗有效,但有些人改善快,有些人无变化,还有些人恶化。

固定效应描述总体平均关系,随机效应描述个体围绕总体关系的分布。只报告平均斜率,会把重要的异质性藏起来。

随机截距与斜率还可能相关。症状更重的人可能改善更快,因为有更大下降空间;也可能改善更慢,因为问题更复杂。该相关需要理论解释,而不是只作为软件输出。

时间不是一个简单数字

把时间编码成 0、1、2、3 隐含线性变化。很多心理过程却不是直线。

学习常在早期快速提升,之后进入平台;哀伤可能先加重再缓解;治疗作用可能延迟出现;青春期变化可能在某个阶段转折。

研究者可以使用多项式、分段线性模型、样条或非线性增长模型。选择应来自理论与测量频率,不能只比较哪个曲线最好看。

时间零点同样重要。把零点放在治疗开始、事件发生或有实际意义的年龄,截距才有可解释性。若零点远离观测范围,截距只是外推出来的虚构数字。

增长曲线与潜在变化

多层增长模型把重复测量嵌套在个体内,适合不等间隔观测和不同次数的记录。

结构方程框架中的潜在增长曲线模型则把起点和斜率视为潜变量,可以显式处理测量误差,并与其他潜变量连接。

两者并非竞争的阵营,而是不同参数化语言。选择取决于研究问题、测量模型、样本结构和软件生态。

如果研究关心两个变量如何共同变化,还可使用平行过程增长模型。但“两个斜率相关”仍不证明一个变化导致另一个变化,它可能来自共同原因。

交叉滞后模型的承诺与陷阱

交叉滞后面板模型常被用于判断 A 是否预测未来 B,同时控制 B 的前一期水平。

传统模型容易把稳定的个体差异混入时间过程。例如长期自尊低的人长期抑郁高,会产生跨时关联,即使某个人自尊的短期下降并不导致随后抑郁。

随机截距交叉滞后模型试图分离稳定个体差异与个体内波动,但它也依赖时间间隔、平稳性和测量等值等假设。

滞后系数不是因果证据的自动生成器。未测量的时变混杂、反馈回路、时间尺度不匹配和选择性流失都可能改变结果。

密集纵向数据与动态系统

体验抽样、生态瞬时评估、可穿戴设备和手机感测能够每天甚至每小时记录情绪、位置、睡眠和互动。

高频数据让研究者观察短期反馈:压力是否提高反刍,反刍是否进一步延长压力;睡眠不足是否增加第二天威胁知觉;社交接触的作用是否因人而异。

但数据点多不等于独立信息多。一个人提供一千条记录,不能替代一千个有代表性的个体。高频测量也可能引起疲劳、反应性和隐私风险。

动态结构方程、向量自回归和时间序列模型可以描述滞后网络,但需要足够时间点、合理采样间隔和稳定过程。过密或过疏都可能看不到真正机制。

缺失与流失不是小问题

纵向研究几乎必然缺失。参与者会漏答某次问卷,也会永久退出。

若缺失只与已观测信息有关,最大似然和多重插补可以在明确假设下减少偏差。但心理研究中的流失常与未观测状态相关:症状最重、生活最不稳定或干预效果最差的人更可能退出。

研究者应描述每个时间点的留存率、比较留存者与退出者、记录退出原因,并做不同缺失机制下的敏感性分析。

“模型可以处理缺失”不代表缺失机制不必讨论。软件处理的是数学条件,不是现实选择过程。

测量必须随时间保持含义

如果量表在不同时间点测量的构念含义改变,增长曲线会把尺子变化误当作心理变化。

因此纵向分析需要先检查形态、载荷和截距等值。儿童随着语言能力提高,可能以不同方式理解题目;治疗也可能改变患者对症状的认识,即所谓反应转移。

不等值未必意味着研究失败。它可能揭示构念本身在发展或治疗中重组,但此时必须改变问题,不能继续把总分差异解释为同一尺度上的增长。

时间变动混杂与因果解释

纵向顺序是因果推断的重要条件,但“先发生”不等于“导致”。

压力今天发生、失眠明天出现,仍可能由工作危机共同造成。更复杂的是,过去的治疗会影响现在的症状,而现在的症状又影响后续治疗选择,形成时间变动混杂。

边际结构模型、固定效应模型和自然实验设计可以处理部分问题,但都依赖额外假设。研究者应画出因果图,明确哪些变量是混杂、机制或碰撞点,避免机械控制。

纵向模型提高了机制推断的分辨率,却不能替代研究设计。

样本量不只是人数

纵向多层研究的精度取决于多个维度:参与者数量、每人测量次数、时间分布、组群数量、组内相关以及效应异质性。

增加同一个人的测量次数主要提高个体内效应精度;增加参与者更有助于估计个体间差异和随机效应。若研究学校层作用,关键是学校数量,而不是每所学校无限增加学生。

解析公式常难覆盖复杂设计。基于预期参数和缺失率的模拟功效分析更透明,也能提前发现模型无法识别的问题。

模型诊断与稳健性

多层模型需要检查残差分布、异常个体、随机效应结构、时间相关和异方差。

把随机效应删到模型收敛,可能让标准误过小;盲目保留过度复杂结构,也可能导致不可识别。收敛警告是数据和模型不匹配的信号,不是换一个优化器后就可忽略。

应比较不同时间函数、中心化方法和缺失处理,绘制个体轨迹与模型预测,并报告核心结论在合理替代设定下是否稳定。

可视化尤其关键。总体平滑曲线可能掩盖相反的个体轨迹,均值改善也可能由少数快速改善者驱动。

伦理与参与者负担

重复测量会进入参与者的日常生活。提醒过频可能增加焦虑,症状追踪可能强化自我监控,位置和睡眠数据可能暴露亲密关系、工作与健康状态。

研究设计应遵循数据最小化,说明采集频率、保留期限、访问权限和退出机制。参与者退出后,未来感测应立即停止。

密集研究还要考虑数字排斥。要求新型手机、稳定网络或持续充电,会系统性排除资源不足的人,并使结论偏向便利样本。

如何阅读一项纵向研究

先看它实际观察了多少人、多少次、多久,而不是只看总记录数。

再看时间间隔是否匹配理论过程,是否区分个体内和个体间关系。

检查流失、测量等值、随机效应和非线性是否得到处理。

最后判断作者是否把时间顺序夸大成因果,是否展示个体差异,以及结论能否推广到未被纳入的人群。

跨域连接

  • 统计学:多层模型的核心贡献是把"同一个人被反复测量"这一结构显式建模,而非当作独立观测。忽略嵌套会低估标准误、夸大显著性——这是心理学文献中一类系统性的、可被追溯的错误来源。
  • 因果推断的可信性革命:纵向数据常被当作因果证据,而它只解决了时序问题,未解决混杂问题。固定效应模型能吸收时间恒定的混杂,代价是它无法估计任何不随时间变化的变量的效应,且对测量误差更敏感——这一取舍必须被明说。
  • 睡眠与心智:睡眠与心理健康的关系是双向的,而分辨方向需要能在个体内区分"这个人一贯睡得少"与"他昨晚睡得比自己平常少"的模型。多层模型正是为此设计的:把个体间差异与个体内变化拆开,是这类问题唯一可行的分析路径。
  • 机器学习概览:层级模型中的收缩与机器学习中的正则化同源——组内数据少时估计向总体均值收缩。这一机制解释了为何多层模型在小组别、不平衡数据上比分组分别拟合更稳健,也把"借力"这一直觉变成了可计算的偏差—方差权衡。
  • 数字表型与计算伦理:被动传感产生的高频纵向数据把这类模型推向新的规模,而新的问题随之出现:测量频率本身影响所测的量(提示会改变行为),且缺失往往与结果相关(状态最差时最不可能作答)。这类非随机缺失在传统纵向研究中已是难题,在高频数据中被放大。

方法的核心判断

纵向研究的重点不是“有很多时间点”,而是对变化提出清楚问题:

谁在变,沿什么时间尺度变,变化发生在哪个层级,又有哪些选择过程让我们看不到完整轨迹?

多层模型能把平均趋势拆成有意义的层次,但只有在测量稳定、时间设计合理、缺失透明和因果边界清楚时,影片才比照片告诉我们更多。

参考文献

  1. Curran, P. J., & Bauer, D. J. (2011). The disaggregation of within-person and between-person effects in longitudinal models of change. Annual Review of Psychology, 62, 583-619.
  2. Singer, J. D., & Willett, J. B. (2003). Applied Longitudinal Data Analysis. Oxford University Press.
  3. Raudenbush, S. W., & Bryk, A. S. (2002). Hierarchical Linear Models (2nd ed.). SAGE.
  4. Hamaker, E. L., Kuiper, R. M., & Grasman, R. P. P. P. (2015). A critique of the cross-lagged panel model. Psychological Methods, 20(1), 102-116.
  5. Bolger, N., & Laurenceau, J.-P. (2013). Intensive Longitudinal Methods. Guilford Press.

延伸阅读

  1. McNeish, D., & Matta, T. (2018). Differentiating between mixed-effects and latent-curve approaches. Behavior Research Methods, 50, 1398-1414.
  2. Little, T. D. (2013). Longitudinal Structural Equation Modeling. Guilford Press.
  3. Enders, C. K. (2010). Applied Missing Data Analysis. Guilford Press.