跳转到内容
← 返回知识库
研究方法16 分钟阅读

心理测量学:信度、效度与如何相信一个测验

Psychometrics: Reliability, Validity, and How to Trust a Test

心理测量信度效度效应量经典测验理论项目反应理论

你在网上做了一个"15分钟测出你的真实性格"的测验,结果说你是个外向的人。三天后你又做了一遍,这次说你内向。到底哪个是真的?或者更尖锐的问题:这个测验测的真的是"性格",还是只是测出了你今天的心情? 这两个问题,是心理测量学(psychometrics)的入口:分数在什么条件下足够精确?我们有多少证据支持用这个分数作出某种解释或决定? 前一个问题涉及信度与测量精度,后一个问题涉及效度。现代测量学强调的不是给测验盖上"有效/无效"印章,而是审查一条从作答、计分、解释到使用的推理链。

心理测量学到底在解决什么问题

物理学家测量长度,有米尺;测量温度,有温度计。 心理学家想测量的东西——智力、焦虑、抑郁、外向性——却没有一把现成的尺子。 你不能像量身高一样直接读出一个人的"焦虑值"。 心理测量学就是研究如何把看不见摸不着的心理特质,转化成可信赖的数字的科学。

它的核心难点在于:心理特质是"潜变量"(latent variable),无法直接观测,只能通过一系列问题或任务间接推断。 我们问十个问题,把答案按规则合成为"焦虑分数"。但受访者如何理解题目?分数在不同时间、语言和群体中是否可比?它能否支持筛查、诊断或疗效追踪?这些用途需要不同强度、不同类型的证据。

信度:这把尺子稳不稳

信度(reliability)指的是测量的一致性与稳定性。 一把好的尺子,量同一张桌子两次,结果应该几乎一样。 一个有信度的测验,同一个人在状态相近时重复测,结果也应该接近。

信度常用 0 到 1 之间的系数概括,但它不是测验永久不变的属性。系数取决于被测群体、施测条件、评分规则和我们允许哪些条件变化。"换一天仍应相同"与"换一组等价题仍应相同"定义了不同的误差来源,因此需要不同的信度证据。

重测信度(test-retest):同一批人间隔一段时间再测一次,看两次分数是否高度相关。 如果一个"智力测验"今天测130、下周测95,它的重测信度就很差——那它测的恐怕不是智力,而是当天的心情或运气。

内部一致性:一个测验里测同一特质的题目,彼此应该相互呼应。 最常用的指标是克隆巴赫α系数(Cronbach's alpha)。 直觉上,如果十道题都在测"外向性",那么答了其中一道偏外向的人,在其他题上也该倾向外向。 α系数衡量的就是这种题目之间的协同程度。 实践中常见"α 大于 0.7 即合格"的经验规则,但它不是普适标准。高利害个体决策通常需要比群体研究更高的精度;题目数量增加也会抬高 α。更重要的是,α 的解释依赖一组模型假设,不能证明量表只有一个维度,也不能单独证明题目测量同一构念。McDonald's omega、重测相关、评分者一致性和条件标准误应根据用途组合报告。

评分者信度(inter-rater reliability):当测量需要人来打分时(比如评估一段访谈的焦虑程度),不同评分者对同一对象的评分应当一致。

理解信度的关键比喻是射击:信度高,意味着每一枪都打在靶子上几乎同一个点——但这个点不一定是靶心。 稳定地打偏,仍然是稳定的。 这就引出了效度。

效度:证据能否支撑这次解释和用途

效度(validity)是累积的理论与经验证据对某种分数解释及其预定用途的支持程度。同一份量表用于群体研究、个体筛查和临床诊断,是三个不同的效度主张。一个用途得到支持,不能自动替另一个用途背书。

传统教材常把效度拆成几种"类型",现代专业标准更倾向把它们视为一项统一效度论证的不同证据来源

基于内容的证据:测验题目是否覆盖了目标特质的各个方面。 一个"数学能力测验"如果只考加减法,就缺乏内容效度——它漏掉了代数、几何等关键内容。

基于反应过程的证据:受测者和评分者实际采用的认知过程,是否与设计者想测的过程一致?一道推理题若主要考生僻词汇,就引入了构念无关因素。

基于内部结构的证据:题目之间的关系是否符合理论提出的维度结构?因子分析、项目拟合和局部依赖检查都属于这里。

与其他变量关系的证据:测验分数能否预测或对应某个外部标准。 比如,一个员工选拔测验是否真能预测入职后的工作绩效?如果高分者并不比低分者干得好,这个测验就没有预测价值。

它也包括传统所谓的聚合与区分证据:这个测验是否与理论上相关的指标相联系,同时不与无关指标高度重叠? 比如一个"抑郁量表"得分高的人,是否同时表现出抑郁的其他特征(睡眠障碍、兴趣丧失),而又与无关的特质(如智力)高度相关?

测试后果与公平性证据:分数进入真实决策后,是否出现系统性误判、群体障碍或不预期后果?后果本身不能替代构念证据,但高利害使用必须审查收益、伤害和替代方案。

因此,看到网络"性格测验"时,最有用的问题不是"它有没有效",而是:它公布了什么样本中的精度?为哪一种解释收集了哪些证据?它是否有合适常模?结果被用于娱乐、自我反思还是招聘淘汰?用途越重要,证据责任越高。

效应量:差异有多大,而不只是有没有

心理学研究常报告"两组有显著差异"。 但"显著"(statistically significant)这个词极容易被误解。p 值是在一个指定统计模型及其假设下,衡量数据与该模型某个假设的不相容程度;它不是"结果由偶然造成的概率",也不是零假设为真的概率。无论如何,统计显著性都不说明差异有多大、有多重要。 样本足够大时,一个微不足道的差异也能"显著"。

为了回答"差异有多大",研究者报告效应量(effect size)及其不确定性。 最常用的是科恩的 d(Cohen's d),它把两组的差异用标准差为单位来表达。 科恩曾给出 d 约为 0.2、0.5、0.8 的小、中、大效应参照,但他也强调这些只是缺少领域知识时的约定。教育成绩提高 0.2 个标准差、药物不良反应增加 0.2 个标准差和实验室反应时变化 0.2 个标准差,实际意义完全不同。 另一个常见指标是相关系数 r,用于衡量两个变量关联的强度。

举个例子:某新疗法让抑郁分数平均下降了"显著"的2分。 如果这2分相对于个体差异(标准差)微乎其微(d=0.1),那么即便统计上显著,临床上也几乎没人感觉得到变化。 效应量必须与置信区间、测量误差、最小实际重要差异和决策代价一起解释,才能把研究从"有没有"推进到"值不值得在意"。 近年心理学的"可重复性危机"促使学界越来越强调报告效应量与置信区间,而非只盯着 p 值是否小于0.05。

标准化:分数怎么才有意义

一个孤立的分数——比如"焦虑得分37"——本身毫无意义。 37是高是低?要回答这个问题,必须把它放进一个参照群体里。 这就是标准化(standardization)。

标准化的做法是:在一个有代表性的大样本(常模样本)上施测,记录分数的分布,然后把任何个体分数换算成相对位置。 最常见的转换是 Z 分数(距离平均数几个标准差)和百分位(超过了参照群体中百分之多少的人)。 许多智力测验把特定年龄常模中的分数缩放为平均数 100、标准差 15。在分布近似正态等条件下,130 大致对应同龄常模的第 98 百分位;它不是跨测验、跨时代都固定不变的绝对脑力读数。

标准化也提醒我们一个常被忽略的陷阱:常模会过时,也可能不适用于不同文化群体。 一个在某国城市儿童身上建立常模的测验,直接拿去测另一文化背景的儿童,结果可能严重失真——这既是效度问题,也是测验公平性(test fairness)的问题。

经典测验理论 vs 项目反应理论

测量心理特质有两套主要的理论框架,理解它们的区别能帮你看清现代测验为什么越来越"聪明"。

经典测验理论(Classical Test Theory, CTT)的核心公式朴素得惊人:观测分数 = 真分数 + 误差。 你测出来的分数,等于那个看不见的"真实水平"加上一堆随机噪声。 CTT 关注的是整份测验的总分及其信度,简单、稳健、应用广泛。 但它有个软肋:许多题目与分数统计量依赖具体样本和测验形式,跨题本或跨群体比较需要额外的等值与链接证据。

项目反应理论(Item Response Theory, IRT)则把焦点从"整份测验"转向"每一道题"。 它为每道题建立一条数学曲线,刻画"不同能力水平的人答对这道题的概率"。 通过这种方式,IRT 能在模型成立且量尺被锚定的条件下,同时估计题目的难度、区分度被试的潜在水平。所谓参数相对不变性是模型性质,不是数据的自动保证;单维性、局部独立、模型拟合和差异项目功能(DIF)都需要检查。

IRT 最实用的产物是计算机自适应测验(CAT)。 当你做某些标准化考试(如部分版本的 GRE)时,系统会根据你前面答对答错动态调整后面的题目难度:答对了就给更难的题,答错了就给更简单的题。 这样有机会用更少的题目达到目标精度——这正是 IRT 驱动自适应测验的原理。但题库安全、内容覆盖、停止规则和不同群体中的公平性,会限制算法能怎样选题。

从一个分数到一个决定

假设抑郁筛查量表给出 10 分。专业解释至少要经过四步:

  1. 分数精度:这个分数附近的条件标准误多大,重复测量可能落在哪个范围?
  2. 参照与阈值:阈值来自什么人群,筛查目标更重视灵敏度还是特异度?
  3. 外部证据:访谈、病史、功能受损和其他量表是否支持同一解释?
  4. 决策后果:漏诊与误报各有什么代价,是否需要二次评估?

量表可以为判断提供信息,却很少应当单独承担诊断、录取或雇佣决定。测量素养的核心不是拒绝数字,而是把数字放回产生它的程序、误差和用途之中。

争议与陷阱

心理测量学并非中立无害的技术,它充满需要警惕的争议。

测验公平与偏误:如果一个测验对某些群体系统性地偏低或偏高(即测量不等价,measurement invariance 不成立),用它来做升学、招聘等高利害决策就可能制造或固化不公。 历史上智力测验曾被滥用于支持种族主义和优生学主张,这是心理测量学最沉重的教训之一。

精度高 ≠ 解释成立:一个 α 系数很高的量表,如果构念定义含混、题目只覆盖狭窄侧面,或被拿去支持未经验证的招聘决策,那么高内部一致性并不能挽救这条推理链。

克隆巴赫α被过度崇拜:很多研究者把高α当作"测验很好"的证明,但α受题目数量影响很大(题目越多α越高),也无法证明测验是单一维度的。 统计学家近年呼吁用更恰当的指标(如 McDonald's omega)替代对α的盲目依赖。

潜变量的实在性之争:当我们说测出了"智力"或"外向性",这些构念是真实存在的心理实体,还是研究者为了方便而发明的统计概念?这个问题至今没有定论,也提醒我们:测量工具再精巧,也替代不了对"我们到底在测什么"的清醒追问。

跨域连接

  • 统计学:信度是效度的上界这一关系常被误用为"信度高就够了",而两者的方向相反的情形恰恰最危险:一个内部一致性极高的量表可能只是在反复问同一个问题,从而以窄化构念为代价换取了漂亮的系数。克龙巴赫 α 的高值因此既可能是好消息也可能是坏消息。
  • 教育与文凭制度:高利害测验面临一条结构性规律——一旦分数决定资源分配,测验就会被针对性准备,从而侵蚀其构念效度。这不是某个测验的缺陷,而是所有被用于分配的测量的共同命运,因而效度证据必须在实际使用条件下重新收集。
  • 测量等价与公平比较:效度不是量表的属性而是特定用途下推断的属性——同一份问卷用于筛查与用于比较群体均值,需要的证据完全不同。这一现代效度观的实际含义是:引用"该量表已被验证"这句话本身没有信息量,必须说明验证的是哪一种推断。
  • 法治:心理测量工具进入司法(危险性评估、监护评估、能力评定)时,错误的代价不由施测者承担,因而准入标准应高于临床探索性使用。罗夏测验的争议史是这一原则最完整的反面案例:评分者一致性的改善被当作了效度的证明。
  • 大语言模型:用人类量表评估模型,在心理测量的意义上是一次效度崩塌:量表能推断人的能力,依赖它与大量未被测能力的共变,而模型不具备这一结构。在人类测验上得高分,因而推不出测验之外的表现——这一点在能力评估报告中反复被忽略。

为什么这关乎每个人

只要你做过升学考试、求职测评、人格问卷,甚至网上的心理小测验,你就已经被心理测量学衡量过。 理解信度与效度,意味着你能问出关键问题:这个测验稳定吗?它真的测出了它声称的东西吗?它的常模适合像我这样的人吗? 在一个越来越喜欢用分数和评级给人贴标签的世界里,这种"测量素养"是一种重要的自我保护——它让你既不盲目相信一个数字,也不轻易被一个数字定义。

参考文献

  1. Cronbach, L. J., & Meehl, P. E. (1955). Construct validity in psychological tests. Psychological Bulletin, 52(4), 281-302.
  2. Cohen, J. (1988). Statistical Power Analysis for the Behavioral Sciences (2nd ed.). Lawrence Erlbaum Associates.
  3. Embretson, S. E., & Reise, S. P. (2000). Item Response Theory for Psychologists. Lawrence Erlbaum Associates.
  4. Messick, S. (1995). Validity of psychological assessment. American Psychologist, 50(9), 741-749.
  5. Cronbach, L. J. (1951). Coefficient alpha and the internal structure of tests. Psychometrika, 16(3), 297-334.
  6. AERA, APA, & NCME. (2014). Standards for Educational and Psychological Testing. American Educational Research Association.
  7. Wasserstein, R. L., & Lazar, N. A. (2016). The ASA statement on p-values: Context, process, and purpose. The American Statistician, 70(2), 129-133.

延伸阅读

  1. Nunnally, J. C., & Bernstein, I. H. (1994). Psychometric Theory (3rd ed.). McGraw-Hill.
  2. Furr, R. M., & Bacharach, V. R. (2013). Psychometrics: An Introduction (2nd ed.). SAGE.
  3. McDonald, R. P. (1999). Test Theory: A Unified Treatment. Lawrence Erlbaum Associates.