跳转到内容
← 返回现代研究方法
测量方法心理学方法15 分钟阅读

测量等值与公平比较

Measurement Invariance and Fair Comparison

一份焦虑量表在两个国家的平均分相差五分,能否据此说一个国家的人更焦虑? 答案取决于一个常被跳过的问题:两组人是否以相同方式理解题目,量表是否以相同规则把回答映射成“焦虑”。如果“我常感到坐立不安”在一组人那里主要表示担忧,在另一组人那里更多表示工作节奏快,那么总分虽然使用同一数字,测量的心理含义却可能不同。

测量等值心理测量因子分析跨文化比较测验公平

同一个分数,未必是同一种东西

一份焦虑量表在两个国家的平均分相差五分,能否据此说一个国家的人更焦虑?

答案取决于一个常被跳过的问题:两组人是否以相同方式理解题目,量表是否以相同规则把回答映射成“焦虑”。如果“我常感到坐立不安”在一组人那里主要表示担忧,在另一组人那里更多表示工作节奏快,那么总分虽然使用同一数字,测量的心理含义却可能不同。

测量等值研究的不是群体是否相同,而是测量工具在群体、时间或情境之间是否遵循足够相同的关系。只有先建立这种可比性,平均数差异、发展趋势和政策效果的比较才有清楚含义。

它适用于跨文化研究,也适用于性别、年龄、语言版本、线上与线下施测、临床与普通样本,以及同一人在多个时间点的比较。

先定义要比较什么

等值层级必须服务于明确的目标量。研究者至少要先写清:

  • 目标构念是单一潜变量、多个相关维度,还是形成性指标;
  • 比较的是结构、相关与回归关系、潜变量均值、观测总分,还是分类决策;
  • 目标群体和参照群体如何定义,群体标签是否掩盖重要的组内差异;
  • 比较发生在什么语言、施测方式、时间点和选择机制下;
  • 多大的参数差异会实质改变科学或决策结论。

例如,比较焦虑与睡眠之间的关系通常需要载荷等值;比较潜变量平均值通常还需要标量层面的证据;直接比较总分、信度或个体变化则隐含更强假设。不存在脱离研究目的的“量表已经等值”。

从潜变量到题目反应

抑郁、信任、外向性和工作倦怠不能像身高一样直接读取。研究者通常假设一个不可直接观测的潜变量,再用若干题目的反应去估计它。

确认性因子分析可以把题目反应写成三个部分:

  • 潜变量水平:一个人在目标特质上的位置;
  • 因子载荷:题目对该特质有多敏感;
  • 截距与残差:在潜变量相同时,题目仍可能出现的基线差异和噪声。

等值检验就是比较这些参数在不同群体或时间点是否稳定。它不是寻找“所有参数绝对相等”的完美世界,而是判断哪些比较在现有证据下仍可辩护。

这套表述首先适用于近似连续题目的线性因子模型。Likert 等有序分类题目常使用有序确认性因子分析:模型比较的是类别阈值而非连续模型中的截距,还要说明链接函数、估计量和参数化方式。把有序题目当连续变量处理,有时近似可行,但类别很少、分布偏斜或组间反应分布差异大时,可能改变等值判断。

四个递进层级

形态等值:大家是否在回答同一种结构

形态等值要求各组具有相同的因子结构:哪些题目属于哪个因子,因子数量是否一致。

例如一份幸福感量表在两个文化中都呈现“积极情绪、生活满意度、人际联结”三个维度,才有继续比较的基础。如果一组中“人际联结”是独立维度,另一组中却与生活满意度完全混合,那么同一总分可能已经失去共同结构。

形态等值只说明概念骨架相似,还不能保证分数单位和起点相同。

载荷等值:一分变化是否代表相近变化

载荷等值也称弱等值或度量等值。它要求同一道题对潜变量的敏感程度在各组相近。

若成立,研究者可以比较变量之间的关系,例如焦虑与睡眠的相关在两个群体中是否不同。因为此时潜变量的“刻度单位”大致一致。

若载荷不同,同样一分题目变化在不同群体中可能代表不同幅度的心理变化,相关系数和回归系数就不宜直接比较。

截距等值:零点是否一致

截距等值也称强等值或标量等值。它在载荷相等之外,还要求潜变量相同时,各组对题目的预期回答相近。

只有达到这一层,比较潜变量平均水平才通常具有合理解释。截距差异可能来自翻译语气、社会规范、反应风格或题目中的文化经验,而不一定来自真实心理差异。

例如在实际压力相同的情况下,一组更不愿意选择“非常同意”,观察到的平均分差异就混入了反应风格。

对于有序题目,对应步骤通常检验阈值与载荷约束。不同软件和参数化对“先检验阈值还是载荷”的命名可能不同,因此报告应列出实际约束的参数,而不只写“达到强等值”。

残差等值:测量误差是否相近

严格等值进一步要求题目残差方差相近。它对比较观测分数、信度或个体差异尤其重要,但许多实证研究难以完全满足。

严格等值不是所有研究问题的必要条件。方法选择应由目标决定:比较结构、关系、潜变量均值或个体分数,需要的证据层级不同。

一套可执行的分析流程

第一步不是运行模型,而是确认构念在理论上能否跨群体成立。研究团队应检查翻译、认知访谈、文化语境和样本构成。统计拟合无法挽救概念翻译错误。

第二步分别检查每个群体的测量模型。若单组模型本身不合理,把它们放进多组模型只会让问题更难看清。

第三步依次拟合形态、载荷和截距等值模型,并比较模型拟合变化。卡方差异检验对大样本过于敏感,因此通常结合比较拟合指数、近似误差和残差指标判断。

第四步查看参数、修正指数和题目内容,定位不等值来源。不能只凭自动化指标解除约束,必须说明为什么某题在特定群体中可能表现不同。

第五步做敏感性分析。比较完整等值、部分等值、删除问题题目或采用近似等值时,核心结论是否改变。

第六步在报告中明确哪些比较获得支持,哪些不应进行。一个诚实的结论可能是“相关结构可比较,但群体均值不可直接比较”。

参照组、锚点与尺度识别

潜变量没有天然单位和零点,模型必须选择参照组、固定因子均值与方差,或用一组锚定题目建立共同尺度。换一个参照组通常不应改变实质结论,但会改变部分参数的表达方式。

部分等值尤其依赖锚点。若锚定题目本身存在差异题项功能,其他题目的群体差异也会被扭曲。稳健做法包括:

  • 说明参照组为何适合作为尺度起点;
  • 结合题目内容和统计证据选择锚点;
  • 更换合理锚点和参照组做敏感性分析;
  • 报告潜变量均值差对这些选择是否稳定。

锚点不是纯技术细节。它决定“相同一单位”和“相同零点”如何被定义。

部分等值不是技术通行证

现实中常有少数题目不等值。部分等值允许释放这些参数,同时保留其余题目的共同约束。

这种做法可以合理,但不能变成不断解除约束直到模型拟合良好的游戏。至少需要足够的锚定题目来定义共同尺度,并说明释放参数的理论原因。

如果大量题目都不等值,更合理的结论可能不是“勉强比较”,而是承认该构念在两组中具有不同组织方式。差异本身也可能是重要心理现象。

近似等值和贝叶斯等值允许参数存在小幅偏离。它们比“完全相等或完全不等”的二分判断更接近现实,但需要预先说明多大偏离在实质上可以接受。

当群体或国家很多时,逐项释放约束会迅速失控。对齐优化等方法可以在多数参数近似相等的前提下寻找群体差异,但结果依赖“少量不等值”的稀疏假设。它适合探索大规模比较,不是跳过题目审查、近似误差评估和敏感性分析的通行证。

差异题项功能与项目反应理论

测量等值也可以在项目反应理论框架下研究,常称为差异题项功能

它问的是:在潜在能力相同的条件下,不同群体答对或认同某题的概率是否不同。若差异只体现在总体难度,称为一致性差异;若题目的区分能力也改变,则是非一致性差异。

发现差异题项功能不等于证明题目“歧视”。统计差异可能来自真实的文化表达,也可能来自翻译、情境熟悉度或构念外能力。研究者需要结合题目审查和质性证据解释。

纵向等值:变化是真的,还是尺子变了

纵向研究尤其依赖等值。如果青少年在三年中逐渐用不同方式理解“我担心未来”,量表均值的变化可能部分来自题意变化,而不是焦虑本身变化。

纵向等值检验把不同时间点视为相关的测量条件,并处理同一道题跨时间的残差相关。达到标量等值后,潜变量增长曲线才有稳定的起点和刻度。

重大事件也可能改变测量含义。疫情、战争、失业或诊断标签普及后,人们对“孤独”“风险”“疲惫”的理解会发生变化。此时测量漂移本身值得研究。

样本选择也会制造表面不等值

等值模型比较的是进入分析样本的人。如果两组的招募、失访或答题完成机制不同,观察到的题目参数差异可能部分来自样本选择。

例如,高症状参与者只在某一组更容易退出,剩余样本中的题目相关结构会改变;只保留完整答卷也可能把教育程度、数字素养或病情严重度的差异带入模型。反过来,在一个高度筛选的样本中得到等值,也不能自动推广到未被纳入的人群。

因此应报告各组招募与缺失流程,比较关键变量的支持范围,并对合理的缺失机制、抽样权重和纳入标准做敏感性分析。测量等值不能单独修复选择偏差。

公平不等于所有人参数完全相同

公平性是规范判断,等值性是经验问题,两者不能互相替代。

一个测验可能统计上近似等值,却因使用场景、机会差异或错误成本分配而不公平。反过来,一道题存在轻微不等值,也不意味着整个测验必然不可用。

高利害决策还要检查:

  • 不同群体的预测误差和误判代价;
  • 常模是否具有代表性;
  • 是否提供合理便利和语言支持;
  • 被测者能否申诉与复核;
  • 测验结果是否被用于超出效度证据的目的。

因此,测量公平需要心理测量、伦理、法律和制度设计共同参与。

常见误区

先比较均值,再补做等值检验会颠倒推理顺序。可比性应是群体结论的前提,而不是显著差异后的装饰。

不显著就等于等值也不成立。小样本可能没有能力发现重要偏离,应同时看参数差异、区间和实际后果。

模型拟合好就证明文化相同是过度解释。等值只支持特定测量关系相近,不否认群体内部异质性,也不证明心理机制完全一致。

把群体当作自然类别会掩盖交叉差异。“国家”“性别”或“族群”内部通常高度多样,语言、阶层、迁移经历和年龄可能比粗略标签更重要。

如何阅读一项跨群体研究

先问量表是否经过目标语言和人群的适配,而不只是字面翻译。

再问研究比较的是观测总分还是潜变量。观测总分隐含更强的测量假设。

接着检查等值层级是否匹配结论:只达到载荷等值的研究,不应强推群体均值高低。

最后看不等值如何处理、样本量是否足够、群体划分是否过度简化,以及替代模型是否改变结论。

跨域连接

  • 统计学:测量等价的检验有清晰的层级——形态、载荷、截距、残差依次受约束,而只有截距等价成立时,组间均值的比较才有意义。这一顺序把"能不能比"从直觉问题变成了可报告的模型拟合比较,也是这一方法最实用的贡献。
  • 大五人格:跨文化人格比较是这一问题最常见的犯错现场——国别均值被广泛引用,而支撑它的测量等价检验往往缺失或未通过。更麻烦的是参照群体效应:受访者以本地常模为参照作答,使自评量表在跨文化比较中系统性失真。
  • 认识正义:测量偏差不是技术瑕疵而是分配后果——当筛查工具的条目偏向特定人群的表达方式时,其他人群被系统性漏诊。进食障碍与抑郁的性别、族群差异中,有多大比例来自真实差异、多大比例来自工具,至今是开放问题,而这直接影响谁能获得治疗。
  • 教育与文凭制度:教育测验中的项目功能差异检验与此同源,而它在高利害场景中的政治敏感度更高:一个条目对某群体系统性更难,可能反映课程差异而非能力差异。这使技术判断与教育公平判断无法分离,也是标准化测验争议的核心。
  • 大语言模型:把人类量表用于评估模型,其效度前提在根本上不成立——量表能推断人的能力,依赖它与大量未被测的能力共变,而模型没有这一共变结构。这是测量等价问题的极端版本:两个"群体"之间不存在任何可比的潜变量结构。

方法的核心判断

测量等值最重要的贡献,不是一套拟合指数,而是一条认识论纪律:

在解释群体差异之前,先证明差异不是由尺子的刻度、零点或含义变化制造出来的。

比较从来不是把两列平均数并排。它需要建立共同构念、共同尺度和透明边界。无法建立时,停止比较也可能是最科学的结果。

参考文献

  1. Putnick, D. L., & Bornstein, M. H. (2016). Measurement invariance conventions and reporting. Developmental Review, 41, 71-90.
  2. Vandenberg, R. J., & Lance, C. E. (2000). A review and synthesis of the measurement invariance literature. Organizational Research Methods, 3(1), 4-70.
  3. Meredith, W. (1993). Measurement invariance, factor analysis and factorial invariance. Psychometrika, 58, 525-543.
  4. Millsap, R. E. (2011). Statistical Approaches to Measurement Invariance. Routledge.
  5. Chen, F. F. (2007). Sensitivity of goodness of fit indexes to lack of measurement invariance. Structural Equation Modeling, 14(3), 464-504.
  6. Svetina, D., Rutkowski, L., & Rutkowski, D. (2020). Multiple-group invariance with categorical outcomes using updated guidelines. Structural Equation Modeling, 27(1), 111-130.
  7. Asparouhov, T., & Muthén, B. (2014). Multiple-group factor analysis alignment. Structural Equation Modeling, 21(4), 495-508.

延伸阅读

  1. Davidov, E., Schmidt, P., Billiet, J., & Meuleman, B. (Eds.). (2018). Cross-Cultural Analysis: Methods and Applications. Routledge.
  2. van de Schoot, R., Lugtig, P., & Hox, J. (2012). A checklist for testing measurement invariance. European Journal of Developmental Psychology, 9(4), 486-492.
  3. International Test Commission. (2017). The ITC Guidelines for Translating and Adapting Tests.