跳转到内容
← 返回深度阅读
统计学15 分钟阅读

贝叶斯统计入门

概率统计机器学习推断

关键词

贝叶斯定理; 先验分布; 后验推断; 频率派; 贝叶斯神经网络; 不确定性量化; 马尔可夫链蒙特卡洛

第1页 · 一个反直觉的医学问题

标题:为什么"99%准确"的检测结果可能毫无意义?

假设你去医院做了一项罕见病的筛查。医生告诉你:这种病的患病率是千分之一(0.1%),检测试剂的灵敏度(真阳性率)是 99%,特异度(真阴性率)也是 99%。你的检测结果是阳性。你真正患病的概率是多少?大多数人会回答"99%"或至少"90%以上"。但贝叶斯定理给出的答案令人震惊——大约只有 9%。设事件 $H$ 为"患病",事件 $D$ 为"检测阳性"。贝叶斯定理告诉我们:

P(HD)=P(DH)P(H)P(D)P(H|D) = \frac{P(D|H) \cdot P(H)}{P(D)}

其中 P(D)=P(DH)P(H)+P(D¬H)P(¬H)P(D) = P(D|H) \cdot P(H) + P(D|\neg H) \cdot P(\neg H)。代入数字:

P(HD)=0.99×0.0010.99×0.001+0.01×0.9990.09P(H|D) = \frac{0.99 \times 0.001}{0.99 \times 0.001 + 0.01 \times 0.999} \approx 0.09

这个结果揭示了一个深刻的事实:即使检测本身很准确,当基础事件本身很罕见时,阳性结果的可信度远低于直觉预期。 这就是为什么大规模筛查健康人群时会产生大量假阳性——也是贝叶斯思维的第一个教训。

第2页 · 贝叶斯定理的直觉

标题:从垃圾邮件过滤到法庭审判——贝叶斯无处不在

贝叶斯定理的数学形式极其简洁:P(AB)=P(BA)P(A)P(B)P(A|B) = \frac{P(B|A) \cdot P(A)}{P(B)}。它说的是:已知 B 发生的条件下 A 发生的概率,等于已知 A 发生的条件下 B 发生的概率,乘以 A 本身的概率,再除以 B 本身的概率。

垃圾邮件过滤是贝叶斯定理的经典应用。当一封邮件包含"免费""中奖""点击领取"等词汇时,它是垃圾邮件的概率是多少?朴素贝叶斯分类器通过统计训练数据中每个词在正常邮件和垃圾邮件中出现的频率,计算 $P(\text{垃圾邮件}|\text{词1}, \text{词2}, \ldots)$,从而做出分类。Paul Graham 在 2002 年发表的《A Plan for Spam》使这一方法广为人知,至今仍是许多邮件过滤系统的基础。

法庭审判中的"检察官谬误"(Prosecutor's Fallacy)是另一个例子。如果被告的 DNA 与犯罪现场匹配的概率是百万分之一($P(\text{匹配}|\text{无辜}) = 10^{-6}$),检察官可能会说"被告无辜的概率只有百万分之一"。但这是错的——混淆了 $P(\text{匹配}|\text{无辜})$$P(\text{无辜}|\text{匹配})$。正确的计算需要考虑被告的先验无罪概率,这在法律和统计学的交叉领域引发了持续的争论。

第3页 · 先验、似然与后验

标题:贝叶斯推断的三大支柱

贝叶斯推断的核心是三个概念的三角关系:

  • 先验(Prior) P(θ)P(\theta):在看到数据之前,我们对参数 θ\theta 的信念。先验可以基于以往的经验、专家知识,或者在缺乏信息时使用"无信息先验"(如均匀分布)。
  • 似然(Likelihood) P(Dθ)P(D|\theta):如果参数取值为 θ\theta,观测到当前数据 $D$ 的概率。似然函数描述了数据对参数的"支持程度"。
  • 后验(Posterior) P(θD)P(\theta|D):看到数据之后,我们对参数的更新信念。后验是贝叶斯推断的最终产出。

它们的关系正是贝叶斯定理:

P(θD)=P(Dθ)P(θ)P(D)P(Dθ)P(θ)P(\theta|D) = \frac{P(D|\theta) \cdot P(\theta)}{P(D)} \propto P(D|\theta) \cdot P(\theta)

分母 $P(D)$ 是"边缘似然"或"证据"(evidence),它是一个归一化常数,确保后验是一个合法的概率分布。在实际计算中,我们常写成"后验 \propto 似然 ×\times 先验"——这是一个极其优美的结构。

先验的选择是贝叶斯统计中最具争议性的话题。频率派批评说先验是"主观的",不同的先验会导致不同的结论。贝叶斯派回应说:所有统计推断都依赖假设,先验只是把假设显式化了。而且,随着数据量增大,先验的影响会逐渐消失——后验会被数据"淹没"。这叫做"先验稳健性"。

第4页 · 贝叶斯更新的迭代之美

标题:一次又一次地学习——贝叶斯更新的动态过程

贝叶斯推断最优雅的特性之一是它的迭代性:今天的后验就是明天的先验。当你获得第一批数据 D1D_1 时,你从先验 P(θ)P(\theta) 更新到后验 P(θD1)P(\theta|D_1)。当新数据 D2D_2 到来时,你把 P(θD1)P(\theta|D_1) 当作新的先验,继续更新:

P(θD1,D2)P(D2θ)P(θD1)P(\theta|D_1, D_2) \propto P(D_2|\theta) \cdot P(\theta|D_1)

这个过程可以无限继续。每一步都把之前的全部信息压缩进后验分布,然后用新数据进一步精炼。这就像一个科学家不断用实验修正自己的理论——贝叶斯更新正是这种科学方法的数学形式化。

一个简单的例子:抛一枚硬币,估计正面概率 θ\theta。先假设 θ\theta 均匀分布在 $[0, 1]$(无信息先验)。抛出第一个正面后,后验变成 Beta(2,1)\text{Beta}(2, 1)——偏向 θ>0.5\theta > 0.5。继续抛出第二个正面,后验变成 Beta(3,1)\text{Beta}(3, 1)——更确信 θ\theta 接近 1。如果第三个是反面,后验变成 Beta(3,2)\text{Beta}(3, 2)——信念回落,认为 θ\theta 大约在 0.5-0.7 之间。这就是贝叶斯学习的动态图景:每一次观测都微调你对世界的认知。

贝叶斯更新与人类认知的关系也引起了心理学家的关注。Kahneman 和 Tversky 的研究表明,人类在实际决策中往往不能很好地进行贝叶斯更新——我们过度依赖直觉而忽略基础概率(base rate neglect),或者被生动的个案所左右。学习贝叶斯思维可以帮助我们成为更好的推理者。

第5页 · 贝叶斯 vs 频率派

标题:统计学的百年战争

统计学史上最深刻的分歧不是技术性的,而是哲学性的:概率是什么?

频率派认为概率是事件在无限次重复试验中发生的频率的极限。参数 θ\theta 是一个固定的、未知的常数——不是一个随机变量。因此,谈论"θ\theta 落在某个区间的概率"是没有意义的——要么在,要么不在。频率派的置信区间说的是:"如果我重复这个实验无数次,95%的置信区间会包含真值。"——这与"真值有 95% 的概率在这个区间里"是不同的陈述。

贝叶斯派认为概率是对信念的度量——一个介于 0 和 1 之间的数,代表我们对某个命题的主观置信度。参数 θ\theta 可以被赋予概率分布,因为我们对它的值不确定。贝叶斯可信区间(credible interval)可以直接说:"θ\theta 有 95% 的概率落在这个区间里。"

两种哲学各有优劣。频率派方法通常计算更简单,不需要选择先验,在大样本下两者结果趋同。贝叶斯方法能自然地处理小样本问题,能融入先验知识,能给出直观的概率陈述,但计算上往往更复杂(需要数值方法如 MCMC)。从实用角度看,当代统计学和机器学习正在走向融合。许多现代方法混合了两种哲学的元素——例如经验贝叶斯(Empirical Bayes)用数据估计先验,频率派的正则化方法可以被重新解释为贝叶斯先验。争论谁对谁错不如理解各自的适用场景。

第6页 · 贝叶斯在当代 AI 中的应用

标题:让 AI 知道自己不知道什么

深度学习革命之后,贝叶斯思想在 AI 领域迎来了复兴。原因在于:传统的深度神经网络给出的是点预测——"这张图片有 95% 的概率是猫"——但它不知道这个 95% 有多可靠。在高风险应用(医疗诊断、自动驾驶、金融风控)中,知道自己"不知道什么"至关重要。

贝叶斯神经网络(Bayesian Neural Networks, BNN)将神经网络的权重视为概率分布而非固定值。给定输入 $x$,输出 $y$ 的预测不是单一值,而是对权重后验的积分:

P(yx,D)=P(yx,w)P(wD)dwP(y|x, D) = \int P(y|x, w) \cdot P(w|D) \, dw

这个积分通常无法解析计算,需要变分推断或 MC Dropout 等近似方法。贝叶斯神经网络的预测包含不确定性量化:对于训练数据附近的输入,不确定性低;对于分布外(out-of-distribution)的输入,不确定性高。这使 AI 系统可以"知道自己何时不知道"。

不确定性量化的另一个重要方向是共形预测(Conformal Prediction),它不依赖贝叶斯框架但能达到类似效果:给每个预测附上一个置信集合,保证真实值以指定概率落在集合内。

大语言模型中的校准问题也与贝叶斯思维密切相关。研究表明,LLM 往往过度自信——它们生成的文本看起来流畅而确定,但事实准确率可能远低于其表现出的自信程度。如何让 LLM 更好地表达不确定性,是当前研究的前沿课题。

第7页 · 日常生活中的贝叶斯思维

标题:像贝叶斯一样思考——一种心智工具

贝叶斯思维不仅是数学工具,更是一种思维方式。以下是几个将贝叶斯思维应用于日常决策的原则:

第一,尊重基础概率(base rate)。 在评估某个事件时,先考虑它的基础概率,再用新证据进行调整。例如,当听到"某创业公司将成为独角兽"时,先想想创业公司成为独角兽的基础概率(大约 0.1%),再看具体的利好消息能提供多少额外信息。

第二,避免确定性思维。 贝叶斯思维的本质是概率性的——没有绝对的"真"和"假",只有不同程度的置信度。当你改变观点时,你不是"被打脸",而是在进行贝叶斯更新。Richard Feynman 说过:"保留怀疑的空间是科学态度的核心。"

第三,注意证据的强度。 不同的证据对信念的更新幅度不同。一条来自可靠信源的精确数据,比十条来自不可靠信源的模糊信息更有价值。贝叶斯公式中的似然函数精确地量化了这一点。

第四,警惕确认偏误。 人类天然倾向于寻找支持自己已有信念的证据,而忽略反驳性证据。在贝叶斯框架下,这意味着我们对支持性证据赋予过高的似然值,对反驳性证据赋予过低的似然值。一个诚实的贝叶斯推理者应该对正反两面的证据给予同等的注意力。

第五,用概率区间而非点估计。 当被问"你认为这件事有多大可能?"时,不要只给一个数字,而是给出一个区间。"我有 70%-85% 的把握"比"我有 80% 的把握"更诚实——它同时传达了你的信念和不确定性。

事实卡

  • 卡1:贝叶斯定理 $P(A|B) = P(B|A)P(A)/P(B)$ 是概率论中最基础也最优美的公式之一,由 Thomas Bayes 在 18 世纪提出,经 Laplace 独立发现并推广。
  • 卡2:在患病率 0.1%、灵敏度和特异度均为 99% 的条件下,阳性检测结果的实际患病概率仅约 9%——这是基础概率忽视的经典案例。
  • 卡3:贝叶斯神经网络将权重视为概率分布,使 AI 能量化自身的不确定性,在医疗和自动驾驶等安全关键领域有重要应用。
  • 卡4:贝叶斯统计的核心争议在于"先验"——频率派认为这是主观的,贝叶斯派认为这只是把隐含假设显式化,且数据量大时先验影响消失。

引用

"贝叶斯定理之于概率论,犹如毕达哥拉斯定理之于几何学。" — E.T. Jaynes

"在概率的频率解释中,你不能说'明天下雨的概率是 30%'——因为明天只发生一次。贝叶斯解释则赋予这句话明确的含义。" — Dennis Lindley

跨域连接

  • 风险与不确定性:奈特把可赋概率的"风险"与无法赋概率的"不确定"分开,主观贝叶斯拒绝这条界线,主张任何命题都能给出一个下注比率。代价是这个数字要为自洽性负责——一组不自洽的赔率会让人被组合下注稳定地抽干,荷兰赌论证正是靠这一点替主观概率辩护。
  • 时间贴现:只有把信念更新与偏好贴现放进同一个期望效用框架,"该不该再等一个证据"才有答案。可检验推论是贴现越陡,人越倾向在证据不足时就行动,这在实验里表现为搜索次数随贴现率上升而下降,也把"何时停止取证"变成可计算的问题。
  • 贝叶斯推断:主观先验听起来任意,但数据一多后验就被似然主导,不同先验会收敛到同一处。这条收敛只在模型没设错时成立——似然函数本身写错了,再多数据也只会让人更自信地错下去,先验的影响反而可能被放大。
  • 集合预报与决策:把"明天三成概率下雨"这类单次事件的概率变成可检验对象,靠的是校准曲线:所有报三成的日子里应当约有三成真的下雨。这让主观概率摆脱了不可证伪的指责,代价是必须长期记录预报与实况——业务预报公布的可靠性图正是这条检验的产物。
  • 决策心理学:人给出的主观概率系统性过度自信,报"九成把握"的判断实际正确率往往低得多。可操作的补救是给区间而非点值,并定期回看历史记录做校准——校准是可训练的技能,自信程度本身不是。

参考文献

  1. Bayes, T. (1763). An Essay towards solving a Problem in the Doctrine of Chances.
  2. Jaynes, E.T. (2003). Probability Theory: The Logic of Science. Cambridge University Press.
  3. McElreath, R. (2020). Statistical Rethinking: A Bayesian Course with Examples in R and Stan. 2nd ed. CRC Press.
  4. Gelman, A., et al. (2013). Bayesian Data Analysis. 3rd ed. CRC Press.
  5. Neal, R.M. (1996). Bayesian Learning for Neural Networks. Springer.
  6. Gal, Y. (2016). Uncertainty in Deep Learning. PhD thesis, University of Cambridge.
  7. Graham, P. (2002). A Plan for Spam. paulgraham.com.