从“是否显著”转向“相信多少”
心理学研究常把结论压缩成一个问题:p 值是否小于 0.05。
这种做法容易把连续证据切成“发现”与“没有发现”,却没有直接回答研究者真正关心的问题:效应可能多大?参数落在某一区间的概率是多少?数据之后,不同解释应如何重新分配可信度?
贝叶斯推断把学习写成一个更新过程:
后验分布 ∝ 似然 × 先验分布
先验表达观察数据前对参数的知识,似然表达不同参数产生当前数据的相对能力,后验则是两者结合后的不确定性分布。
这不是用主观意见替代数据,而是要求研究者把已有知识和假设显式写出来,让它们接受数据检验。
一个直观例子
研究者想估计一种短时干预对焦虑的平均影响。
以往几十项类似干预通常只有小效应,因此把“效果巨大”与“效果接近零”视为同样可能并不合理。研究者可以设置一个以零为中心、允许小到中等效应的先验。
若新样本很大且数据清楚,似然会占主导,后验主要由数据决定。若样本很小或噪声很大,先验会防止估计被偶然的极端均值拉走。
最终结果不是单个点,而是效应大小的分布。研究者可以报告效应为负的后验概率、落在实质无意义区间内的概率,以及达到临床重要阈值的概率。
先验不是一个神秘数字
先验可以来自不同来源。
弱信息先验排除心理学上不可能的参数,同时保留较宽的不确定性。例如量表标准化后,十几个标准差的效应几乎不可信。
信息先验可来自高质量元分析、先导研究或可靠机制知识。
正则化先验把极端估计适度拉向共同中心,尤其适用于许多参数、小样本和多层模型。
怀疑性先验把更多概率放在零附近,可用于检验强主张能否克服既有怀疑。
先验必须与参数尺度相匹配。对原始量表、标准化效应、概率和方差使用同一个“默认先验”通常没有意义。
先验预测检查
设置先验后,不应立刻拟合数据。先从先验中模拟完整数据,观察模型认为哪些世界可能发生。
如果模型频繁生成负的反应时间、超过量表上限的分数或几乎全员患病,说明先验与数据生成机制不协调。
先验预测检查把抽象参数翻译成可观察结果。研究者不必争论某个标准差先验“看起来是否客观”,而可以问:它是否会生成心理学上荒谬的数据?
这是贝叶斯工作流中最实用也最容易被忽略的一步。
后验区间如何解释
一个 95% 后验可信区间表示:在模型、数据和先验给定的条件下,参数有 95% 的后验概率位于该区间。
这与频率学派置信区间的长期重复抽样解释不同。差别不意味着一种必然更科学,而是两套概率语义回答不同问题。
后验概率的自然语言很吸引人,但条件必须完整。它不是“结论有 95% 概率为真”,而是在特定模型和先验下对参数的概率陈述。
错误的似然、遗漏的层级、选择性数据和不合理先验仍会产生看似精确的后验。
实质等价区间与决策
很多问题不应只问效应是否精确等于零。现实中更重要的是效应是否小到没有实质意义。
研究者可以预先定义一个实际等价区间,例如标准化效应在 -0.1 到 0.1 之间视为可忽略,再报告后验有多少概率落入该区间。
阈值必须来自理论、测量精度、临床意义或政策成本,不能在看完结果后调整。
若要做决策,还需加入不同错误的损失。错过有效治疗和采用无效治疗的代价并不相同。贝叶斯决策理论把证据与价值判断分开表达,使取舍更透明。
贝叶斯因子回答什么
贝叶斯因子比较两个模型对数据的预测能力。例如一个模型规定效应为零,另一个允许效应按某个先验分布变化。
贝叶斯因子大于一表示数据在前一个模型下更可预测,反之则支持后一个模型。它可以量化支持零模型的证据,而不是把“不显著”误当作“证明没有效应”。
但贝叶斯因子对备择模型的先验范围敏感。一个极度宽泛的备择模型会把概率分散到大量不合理效应上,从而表现很差。
因此报告贝叶斯因子必须说明模型和先验,并做敏感性分析。单独给出“BF=10”与只给 p 值一样不透明。
层级模型与部分汇聚
心理数据天然具有层级:试次属于参与者,参与者属于实验室或学校,题目属于刺激类别。
贝叶斯层级模型能让各组参数在共同总体中进行部分汇聚。数据少的个体估计更多借用群体信息,数据多的个体保留自身特征。
这比把所有人完全合并更能表达异质性,也比给每个人独立估计更稳定。它还能自然传播各层不确定性。
例如研究面孔识别时,可以同时估计参与者差异、图片差异和实验条件作用,避免把特定刺激集的偶然性误当成普遍心理规律。
生成模型:从结果反推过程
贝叶斯分析不只是一种统计检验,也是一种构建心理过程模型的方式。
研究者先说明潜在机制如何产生行为数据,再从观察反推参数。例如漂移扩散模型把二选一反应拆成证据积累速度、决策阈值和非决策时间。
相同的平均反应时可能由不同机制产生:信息处理更慢、更加谨慎,或动作准备更久。生成模型能把描述性差异转成机制假设。
但参数拥有心理名称不等于模型已证明机制。需要参数可恢复性、模型区分、外部效度和实验操纵共同支持。
计算不是推理的附属品
复杂后验常依赖马尔可夫链蒙特卡洛或变分推断。
研究者必须检查多条链是否混合、有效样本量是否足够、是否存在发散转移,以及参数是否高度相关。没有通过计算诊断的后验摘要不应进入解释。
提高迭代次数有时有用,但发散往往提示模型几何或参数化有问题。重新参数化、缩放变量和使用合理先验通常比盲目延长采样更重要。
计算收敛只说明算法近似了当前模型,并不说明模型适合现实。
后验预测检查
拟合后,从后验中模拟新数据,再与真实数据比较。
模型能否复现反应分布的尾部、组间差异、缺失模式和个体轨迹?若只能拟合均值却无法生成方差或极端反应,它可能遗漏重要机制。
后验预测检查不追求一个万能拟合分数,而是选择与研究问题有关的统计量和图形。模型失配不是尴尬,应成为下一轮理论修正的入口。
预测准确也不保证因果解释正确。多个机制模型可能产生相似数据,需要更有区分力的实验。
模型比较不能替代理论
信息准则、留一法交叉验证和贝叶斯因子可以比较预测表现,但候选模型都可能是错的。
“模型 A 胜过模型 B”只说明在当前候选集、数据和评分规则下 A 更好,不证明 A 是真实心理过程。
交叉验证更关注对未见数据的预测,贝叶斯因子更关注模型的边际预测证据。两者目标不同,不能把数值机械排名。
模型比较前应问:候选模型在哪些观察上给出不同预测?研究设计是否真的能区分它们?
透明性与敏感性分析
贝叶斯分析的自由度可能来自先验、似然、层级结构、采样设置和模型比较方式。
高质量报告应公开模型代码与版本,说明先验来源,展示先验和后验预测检查,报告计算诊断,并比较合理替代先验。
敏感性分析不是把所有先验都试一遍后挑喜欢的结果,而是展示核心结论在可辩护选择范围内如何变化。
如果结论高度依赖某个先验,这不是分析失败,而是说明当前数据不足以压倒已有假设。应诚实呈现这种信息。
与开放科学的关系
贝叶斯方法不能自动消除选择性报告。研究者仍可能更换先验、停止规则或模型,直到得到想要的后验概率。
预注册应记录主要模型、先验族、排除标准、预测检查和决策阈值。探索性模型同样有价值,但应标明它是在看过数据后形成。
顺序贝叶斯更新允许在新数据到来时更新证据,但需要明确采样和决策规则,尤其在资源分配或临床试验中。
开放代码和可复算环境对于发现参数化错误与软件默认值影响尤其重要。
常见误区
贝叶斯就是主观统计忽略了所有模型都包含假设。贝叶斯的优势之一正是把部分假设显式化。
平坦先验代表完全客观并不成立。参数变换后,平坦性会改变;过宽先验还可能生成荒谬预测。
后验概率高就证明理论正确也不成立。概率以候选模型和数据质量为条件,未考虑的理论没有参与竞争。
软件成功运行就完成分析会忽略采样诊断、模型失配和参数可识别性。
贝叶斯能拯救小样本只在先验信息可靠时部分成立。弱数据加弱先验仍是弱证据,漂亮的后验图不能创造信息。
如何阅读一项贝叶斯研究
先问参数和数据生成过程是什么,而不是先看后验概率。
检查先验是否放在有意义的尺度上,是否做过先验预测检查。
再看采样诊断、后验预测和模型敏感性,而不只看可信区间。
如果使用贝叶斯因子,确认备择模型的先验和比较方向。
最后判断结论是否超出模型支持,探索性选择是否被透明标注,数据和代码能否复算。
跨域连接
- 概率:贝叶斯方法在心理学中的价值不只是替代 p 值——它使"证据支持零假设"成为可表达的结论,而这在频率派框架里原则上不可能。对一个充斥着小效应与失败复制的领域,能够说"数据支持无效应"是实质性的能力提升,而非统计风格的偏好。
- 统计学:先验的选择常被当作贝叶斯方法的软肋,而更准确的表述是它把一个本就存在的假设显式化了:频率派的模型设定、检验选择与停止规则同样携带假设,只是不被称为先验。争论的实质因而不是"是否引入主观性",而是"假设是否被写出来接受检查"。
- 预测加工与精神病学:贝叶斯在这一领域有双重身份——既是研究者的分析工具,也是被假设的大脑机制。混用两者是常见错误:用贝叶斯模型拟合行为数据成功,不证明大脑在做贝叶斯推断,因为多种机制可以产生近似最优的行为。
- 可重复性危机与开放科学:贝叶斯因子允许边收集数据边评估证据而不破坏推断的有效性,这直接解决了"看到数据后决定是否继续收集"这一常见的自由度问题。这是方法论改革中少见的情形:新工具正好消除了旧工具的一个具体滥用路径。
- 机器学习概览:层级贝叶斯模型与机器学习中的正则化在数学上同源——先验对参数的收缩等价于惩罚项。这一对应关系有实际用途:它解释了为何层级模型在小样本、多组别的心理学数据上表现更稳健,也把"借力"这一直觉变成了可计算的机制。
方法的核心判断
贝叶斯建模最有价值的地方不是换一套显著性阈值,而是迫使研究者完成一条完整链条:
什么过程可能生成数据,观察前相信什么,数据改变了多少,模型遗漏了什么,结论对选择有多敏感?
只有当先验、似然、计算和预测都可检查时,后验才是可积累的科学证据,而不是新的权威数字。
参考文献
- Wagenmakers, E.-J., et al. (2018). Bayesian inference for psychology. Part I: Theoretical advantages and practical ramifications. Psychonomic Bulletin & Review, 25, 35-57.
- Wagenmakers, E.-J., et al. (2018). Bayesian inference for psychology. Part II: Example applications with JASP. Psychonomic Bulletin & Review, 25, 58-76.
- Gelman, A., et al. (2013). Bayesian Data Analysis (3rd ed.). CRC Press.
- McElreath, R. (2020). Statistical Rethinking (2nd ed.). CRC Press.
- Lee, M. D., & Wagenmakers, E.-J. (2013). Bayesian Cognitive Modeling. Cambridge University Press.
延伸阅读
- Kruschke, J. K. (2015). Doing Bayesian Data Analysis (2nd ed.). Academic Press.
- Schad, D. J., Betancourt, M., & Vasishth, S. (2021). Toward a principled Bayesian workflow in cognitive science. Psychological Methods, 26(1), 103-126.
- van de Schoot, R., et al. (2021). Bayesian statistics and modelling. Nature Reviews Methods Primers, 1, 1.