跳转到内容
← 返回现代研究方法
测量与实验方法心理学方法11 分钟阅读

经验取样与生态瞬时评估

Experience Sampling and Ecological Momentary Assessment

心理学有一个长期被容忍的方法论缺陷:它主要研究人们对自己心理生活的回忆,而不是心理生活本身。 问卷问"过去两周你多常感到焦虑",被试给出的不是一份统计汇总,而是一次重建——受当下心情影响、被最强烈和最近的片段主导、被自我叙事整理过。峰终效应的研究已经证明,人对一段体验的回顾性评价,主要由峰值与结尾决定,而与持续时长几乎…

经验取样生态瞬时评估密集纵向数据个体内变异遍历性

心理学有一个长期被容忍的方法论缺陷:它主要研究人们对自己心理生活的回忆,而不是心理生活本身。

问卷问"过去两周你多常感到焦虑",被试给出的不是一份统计汇总,而是一次重建——受当下心情影响、被最强烈和最近的片段主导、被自我叙事整理过。峰终效应的研究已经证明,人对一段体验的回顾性评价,主要由峰值与结尾决定,而与持续时长几乎无关。这不是记性差,是记忆本来就不是为统计而设计的。

经验取样法(ESM)与生态瞬时评估(EMA)的思路因此很直接:不要问"通常怎样",而是在日常生活中反复截取"此刻怎样"。

一、从传呼机到手机

1970 年代末,契克森米哈赖与拉森给被试配发传呼机,随机时刻发出信号,被试立即在纸质小册上记录当下在做什么、和谁在一起、感受如何。心流理论正是从这类数据里长出来的——它揭示了一个问卷永远问不出的模式:幸福感与活动的匹配程度相关,而不是与活动类型相关

1990 年代,斯通与希夫曼把这套方法在健康心理学中系统化,命名为生态瞬时评估,强调三个要素:在真实环境中在当下多次重复

智能手机让成本坍塌。今天一项 ESM 研究可以覆盖数千人、持续数月、每天多次采样,还能同时接入被动传感数据(位置、活动量、屏幕使用、睡眠)。方法的门槛从"能否做"变成了"能否做好"。

二、三种采样设计

信号触发(signal-contingent):在随机或半随机时刻提示作答。优点是无偏采样个体的时间分布,是研究情绪波动的默认选择;缺点是打断日常生活,且罕见事件几乎采不到。

间隔触发(interval-contingent):固定时点作答(如每天早中晚)。负担低、依从性高,但会错过时点之间的动态,也容易被日程规律污染。

事件触发(event-contingent):特定事件发生后作答(吵架后、吸烟后、进食后)。对研究特定行为极其高效,但依赖被试自己判断"事件发生了"——这本身就是一次可能有偏的认知过程

多数成熟设计是混合的:用信号触发建立基线,用事件触发捕捉目标行为。

三、这套方法真正解决的问题:个体内 ≠ 个体间

ESM 最深刻的贡献不是"更准",而是让一类此前无法回答的问题变得可问。

传统研究比较的是人与人之间的差异:焦虑高的人是否睡得差。ESM 能回答的是同一个人内部的动态:这个人焦虑更高的那些晚上,是否睡得更差。

这两者在数学上没有必然联系。遍历性问题(ergodicity problem)指出:只有在极其严格的条件下(个体间同质、过程平稳),群体层面的规律才能推广到个体层面。而心理过程几乎从不满足这些条件。这意味着大量以群体相关为基础的心理学结论——包括许多临床建议——在逻辑上并不支持"对你个人也成立"

这带来一个直接的分析要求:密集纵向数据必须用多层模型处理,把变异明确拆成个体间与个体内两部分,并对预测变量做组内中心化。否则两种效应会混在一起,得到的系数既不是个体间效应也不是个体内效应,而是两者的加权混合——这是 ESM 数据分析中最常见也最隐蔽的错误。

四、依从性、反应性与负担

ESM 的效度高度依赖被试是否真的在被提示时作答。

依从性:延迟填答会让"瞬时"失去意义。早期纸质研究的经典发现是,被试会在截止前集中补填(所谓"parking lot compliance"),而时间戳技术让这个问题第一次可见。现代研究普遍设定作答窗口(如 10–15 分钟),并把窗口外的数据标记或剔除——剔除规则必须预先声明,否则就成了另一种研究者自由度

反应性:反复报告本身会改变被报告的对象。让人每天四次报告情绪,可能提高情绪觉察,也可能诱发反刍。这既是威胁(污染观测),也是机会(自我监测本身有治疗价值,被用于成瘾与情绪障碍干预)。

负担与选择性流失:问卷越长、频率越高,退出的人越多——而退出往往与研究关心的变量相关(症状最重的人最先退出)。这是 ESM 最严重的效度威胁,因为它把缺失机制与结局绑在了一起。控制手段包括缩短问卷(每次不超过一两分钟)、递进式激励、以及把依从性本身建模而非当作干扰。

功效不是靠人数堆出来的。 密集纵向设计的功效同时取决于被试数、每人测量次数与个体内相关。想估计个体内效应,增加每人测量次数收益大;想估计个体差异的调节效应,增加被试数收益大。用横断面的功效直觉设计 ESM 研究,几乎总会算错。

五、被动感知与它的伦理边界

手机与可穿戴设备能持续记录位置、活动、通话与屏幕使用,无需被试作答。这类数字表型数据把负担降到接近零,但把伦理问题抬到很高:

  • 持续采集的知情同意如何有效? 一次性签署无法覆盖数月连续记录的全部含义。
  • 被动数据的推断力远超被试预期:移动轨迹能推出居所、工作地、就医记录与社会关系。
  • 数据的下游用途难以约束:一旦离开研究情境,同样的信号可用于保险定价或雇佣筛选。

方法上还有一个诱惑需要抵抗:被动指标(如步数、屏幕时长)常被当作心理构念(活动量、社交退缩)的代理,而这一步替换往往没有效度证据。传感器测的是行为,不是心理状态;把两者等同起来,是这个领域当前最需要警惕的滑动。

六、实务清单

  • 预先注册采样设计、作答窗口、依从性纳入标准与缺失数据处理;
  • 用试点数据估计个体内相关,再据此做功效分析;
  • 问卷条目必须为"此刻"改写,不能直接搬用回顾性量表的措辞;
  • 建立多层模型,显式分离个体间与个体内效应,并做组内中心化;
  • 报告依从率、流失率与两者与关键变量的关系,而不只是最终样本;
  • 若使用被动数据,单独说明其效度证据,不要默认它测的是你想测的构念。

跨域连接

  • 纵向与多层模型:ESM 数据天然是嵌套的(时点嵌套于个体,个体可能嵌套于家庭或诊所),忽略这个结构会严重低估标准误。多层模型不只是统计上的合规要求,它直接决定了你估计的是哪一种效应——个体间、个体内还是二者的混合,这个选择必须由研究问题而非软件默认值决定。
  • 峰终效应:回顾性报告被峰值与结尾主导、几乎忽略持续时间,这正是 ESM 存在的理由。它把"记忆自我"与"体验自我"的分歧从一个有趣的实验现象,变成了一个方法论上的强制选择:你想研究的是人实际经历了什么,还是他事后如何叙述?两者的答案经常不同,而问卷只能回答后者。
  • 数字表型与计算伦理:被动感知把测量负担降到零,也把知情同意、数据最小化与再识别风险推到前台。"因为技术上能采集,所以采集"是这个领域最危险的默认设置;而更隐蔽的问题是构念效度——传感器信号与心理构念之间的映射,需要独立验证,不能靠直觉指定。
  • 契克森米哈赖的传呼机研究:心流理论之所以能被提出,正因为它需要的证据只有经验取样能提供——幸福不取决于在做什么,而取决于挑战与技能是否匹配,这个结论在任何回顾性问卷中都会被平均掉。方法与理论在此互为条件,是心理学史上一个罕见的清晰案例。
  • 实时系统:ESM 平台的工程约束与实时系统同构——提示必须在预定时刻送达、作答窗口必须严格计时、时间戳必须可信且不可篡改。当"瞬时"是数据效度的核心,时钟就成了测量仪器的一部分;离线补填、时区处理与推送延迟这些工程细节,会直接转化为科学结论的偏差。

参考文献

  • Csikszentmihalyi, M. & Larson, R. Validity and Reliability of the Experience-Sampling Method. Journal of Nervous and Mental Disease 175(9), 526–536, 1987.
  • Stone, A. A. & Shiffman, S. Ecological Momentary Assessment in Behavioral Medicine. Annals of Behavioral Medicine 16, 199–202, 1994.
  • Molenaar, P. C. M. A Manifesto on Psychology as Idiographic Science. Measurement 2(4), 201–218, 2004.
  • Bolger, N. & Laurenceau, J.-P. Intensive Longitudinal Methods. Guilford Press, 2013.
  • Fisher, A. J., Medaglia, J. D. & Jeronimus, B. F. Lack of Group-to-Individual Generalizability. PNAS 115(27), 2018.

延伸阅读

  • Shiffman, S., Stone, A. A. & Hufford, M. R. Ecological Momentary Assessment. Annual Review of Clinical Psychology 4, 1–32, 2008.
  • Trull, T. J. & Ebner-Priemer, U. Ambulatory Assessment. Annual Review of Clinical Psychology 9, 151–176, 2013.
  • Kahneman, D. et al. A Survey Method for Characterizing Daily Life Experience: The Day Reconstruction Method. Science 306, 1776–1780, 2004.
  • Myin-Germeys, I. & Kuppens, P. (eds.) The Open Handbook of Experience Sampling Methodology. 2nd ed., 2021.