心理学有一类反复出现的困境:两个理论用文字表述时都说得通,也都与数据一致,但它们其实是不同的理论。
"人们在压力下更冲动"——这句话可以指反应阈限降低、证据积累速率变慢、对奖赏更敏感、或者仅仅是运动执行更快。它们对同一批反应时数据给出相同的粗略预测(更快、更多错误),却指向完全不同的机制与干预。
计算建模要求把理论写成可以运行的方程:给定输入,模型必须生成行为,而不只是描述行为。这个要求极其苛刻,也正因如此极其有用——含糊的理论无法被写成代码。
一、四类模型,四种野心
过程模型描述决策如何随时间展开。最有影响力的是漂移扩散模型:证据从起点随时间随机累积,触到某一侧边界即作出相应反应。它用少数几个参数解释整条反应时分布与正确率的联合模式:
- 漂移率 $v$:证据积累速度,反映任务难度与个体能力;
- 边界间距 $a$:谨慎程度,反映速度—准确率权衡;
- 起点 $z$:先验偏向;
- 非决策时间 :编码与运动执行耗时。
它的价值在于把一个混合指标拆开。老年人反应更慢,是加工变慢(漂移率下降)还是更谨慎(边界变宽)?平均反应时无法区分,扩散模型可以——而两者对应完全不同的老化理论。
学习模型描述经验如何改变行为。强化学习模型用预测误差更新价值估计,用 softmax 之类的规则把价值转成选择概率,典型参数是学习率与探索—利用的温度。它们在临床研究中被用来把"动机缺陷"分解为"对奖赏不敏感"还是"学不会关联"。
理想观察者模型(贝叶斯模型)问的是另一个问题:给定任务的统计结构,最优表现是什么?把人的表现与最优基准比较,偏离本身携带信息。这类模型不假装描述神经过程,而是划定行为的规范上界。
神经网络模型用可训练的参数化系统模拟能力的形成过程,长处是能处理高维真实刺激,短处是参数极多、难以解释。
二、拟合得好,不等于是对的
这是计算建模全部方法论的核心,也是最常被跳过的一步。
参数恢复(parameter recovery):用已知参数从模型生成模拟数据,再用拟合流程去估计参数,看能否还原。若无法还原,那么在真实数据上得到的参数值就没有意义。这一步失败的常见原因是数据量不足——扩散模型的稳定估计通常需要每条件上百试次,而许多研究只有几十。
模型恢复(model recovery):用模型 A 生成数据,用 A 与 B 分别拟合,看模型比较是否能选出 A;反之亦然。若两个模型互相无法区分,那么"数据支持模型 A"这句话就是空的。
可识别性:不同参数组合可能给出几乎相同的预测(例如漂移率与边界间距在某些设计下高度相关)。此时估计值会剧烈依赖初值与先验,而拟合优度看起来毫无问题。实验设计必须为区分参数而设计——加入操纵速度—准确率权衡的条件,正是为了把这两个参数拆开。
后验预测检验:把拟合好的模型当作生成器,产生模拟数据,与真实数据的关键统计量(反应时分布形状、学习曲线、序列效应)对照。只报告拟合优度指标而不做这一步,是当前文献最普遍的缺陷——一个 AIC 更低的模型,完全可能在质的层面预测错误。
三、模型比较的陷阱
模型越复杂,拟合越好,这是必然的。因此比较必须惩罚复杂度:AIC、BIC 用参数个数近似惩罚,交叉验证与 WAIC/LOO 直接估计样本外预测能力。
三个常见误用:
用嵌套模型的检验去比较非嵌套模型——似然比检验的分布假设不成立。
忽略参数个数之外的柔性。两个参数数量相同的模型可能柔性差异很大(一个只能画出单调曲线,另一个能画出任意形状)。参数计数是复杂度的粗劣代理,最小描述长度与贝叶斯因子提供了更严格但计算更贵的替代。
在个体层面选模型,然后汇总"多少人支持模型 A"。这既忽略了个体层面的估计不确定性,也无法处理"不同人用不同策略"这一真实可能。分层模型(同时估计群体与个体参数,并让个体估计向群体均值收缩)是当前更被接受的做法。
四、模型能回答什么样的问题
计算建模的最佳用法不是"证明我的理论对",而是以下三类。
分解一个混合指标:把反应时、正确率或选择比例拆成有理论含义的成分。这是扩散模型最成功的应用,也是临床研究中最有价值的用法——两组人的正确率相同,但机制可以完全不同。
做出定量而非定性的预测:文字理论只能预测方向("A 条件下更慢"),模型能预测幅度与分布形状。预测越精确,被证伪的机会越多,理论的信息量也越大。
揭示理论的隐含承诺:把理论写成方程后,常会发现它蕴含了作者从未意识到的预测,或者发现它在数学上根本无法产生所声称的行为。这类"实现失败"是建模最有价值的产出之一,却极少被发表。
它不能做什么:模型拟合不能证明大脑执行了该算法。同一行为可以由多种算法产生(等价性问题),而行为数据原则上无法区分它们——这需要神经或干预证据。"扩散模型拟合得好"意味着"行为与证据累积一致",不意味着"大脑在累积证据"。
五、实务清单
- 在收数据之前用模拟确定:这个设计能否恢复我关心的参数?需要多少试次?
- 预注册模型集合与比较准则,避免事后加模型直到得到想要的结论;
- 报告参数恢复与模型恢复结果,而不只是拟合优度;
- 做后验预测检验,并展示模型失配的地方;
- 使用分层模型,报告群体与个体两级的不确定性;
- 公开代码与拟合流程——建模结果对实现细节的敏感度高于多数统计分析。
跨域连接
- 心理学中的贝叶斯建模:分层贝叶斯是当前认知建模的主流实现方式,因为它天然处理个体差异与不确定性传播。先验在这里不是主观污染,而是把"参数应当落在合理范围"这一领域知识显式写出来——扩散模型的非决策时间不可能是负数,把这个约束写进先验,比在优化器里加边界更诚实也更稳定。
- 决策心理学:前景理论、启发式与偏差研究提供了大量文字理论,而计算建模是检验它们的手段。很多经典效应在被写成生成模型后暴露出多重解释——例如损失厌恶在选择数据上的表现,可以由效用函数弯曲、注意力分配或反应偏差分别产生,而区分它们需要专门设计的实验而非更多的数据。
- 统计学习理论与 PAC 学习:过拟合与模型选择在两个领域是同一个问题的不同表述——认知建模里的 AIC/BIC 与机器学习里的正则化和交叉验证,处理的都是"柔性越大越容易拟合噪声"。参数计数是复杂度的粗劣代理这一点,在两边同样成立,而深度学习中双下降现象的发现,也在提醒认知建模者:复杂度与泛化的关系比教科书图景更复杂。
- 预测加工与计算精神病学:把精神症状表述为特定参数的偏移(学习率异常、精度加权失调),是计算精神病学的核心策略。它的吸引力在于把描述性诊断换成机制性参数,风险在于参数的临床意义往往缺乏独立验证——一个能区分患者与对照的参数,未必对应任何可干预的机制。
- 形式化方法与验证:把理论写成可执行代码,与把规格写成形式化规范,动机完全一致——自然语言无法暴露自身的歧义与矛盾,形式化可以。两个领域也共享同一个教训:形式化最大的收益常常发生在书写过程中,因为你被迫回答那些含糊表述允许你回避的问题。
参考文献
- Ratcliff, R. & McKoon, G. The Diffusion Decision Model: Theory and Data for Two-Choice Decision Tasks. Neural Computation 20(4), 873–922, 2008.
- Wilson, R. C. & Collins, A. G. E. Ten Simple Rules for the Computational Modeling of Behavioral Data. eLife 8:e49547, 2019.
- Palminteri, S., Wyart, V. & Koechlin, E. The Importance of Falsification in Computational Cognitive Modeling. Trends in Cognitive Sciences 21(6), 425–433, 2017.
- Lee, M. D. & Wagenmakers, E.-J. Bayesian Cognitive Modeling: A Practical Course. Cambridge University Press, 2013.
- Marr, D. Vision. W. H. Freeman, 1982(计算、算法与实现三个分析层次的经典区分)。
延伸阅读
- Farrell, S. & Lewandowsky, S. Computational Modeling of Cognition and Behavior. Cambridge University Press, 2018.
- Daw, N. D. Trial-by-Trial Data Analysis Using Computational Models. In: Decision Making, Affect, and Learning, Oxford University Press, 2011.
- Roberts, S. & Pashler, H. How Persuasive Is a Good Fit? A Comment on Theory Testing. Psychological Review 107(2), 358–367, 2000.
- Guest, O. & Martin, A. E. How Computational Modeling Can Force Theory Building in Psychological Science. Perspectives on Psychological Science 16(4), 2021.