跳转到内容
← 返回概念
应用数学18 分钟阅读

统计学

Statistics

关键人物

fisherpearsonbayesneyman
应用统计学推断回归假设检验

一个直觉:尝一勺汤,就能判断整锅咸淡

要知道一大锅汤够不够咸,你不必把整锅喝完——搅匀,舀一勺尝尝,就敢下结论。这个再朴素不过的动作,正是整个统计学的缩影:用手里这一小撮样本,去推断你看不全的整体。民意调查问几千人就敢预测上亿人的投票倾向,药厂试验几百名患者就能判断一款药对所有病人是否有效,靠的都是这同一套逻辑。

但这里立刻冒出一个绕不开的难题,也是统计学真正的灵魂:从局部猜整体,永远带着不确定性。换一勺汤、换一批受访者,答案多少会变一点。所以统计学家从不只给一个干巴巴的数字,而是连同它的"误差范围"一起给——这就是为什么你总听到"支持率 52%52\%,误差正负 3%3\%"。一个不诚实地标出自己有多不确定的估计,在统计学里是没有意义的。

还要破除一个极其常见的误解。新闻里那个"$p$ 值小于 $0.05$,结果显著",并不是说"这个结论有 95%95\% 的概率为真"。它的真正含义要拐个弯:假如所研究的效应根本不存在,那么纯靠运气也能撞出像眼前这么极端(甚至更极端)的数据的概率,小于 5%5\%。正因为这层逻辑微妙得反直觉,无数研究才在这里栽了跟头。统计学的难,从来不在公式,而在于如何诚实地面对随机性——既不被噪声欺骗,也不夸大手中证据的分量。

定义

统计学(Statistics)是从数据中提取信息、做出推断的科学——它是数学与现实世界之间的桥梁。

参数估计:从样本数据推断总体参数。点估计给出单一值(如样本均值 Xˉ\bar{X}),区间估计给出参数的置信区间(如95%置信区间 [Xˉ1.96σn,Xˉ+1.96σn][\bar{X} - 1.96\frac{\sigma}{\sqrt{n}}, \bar{X} + 1.96\frac{\sigma}{\sqrt{n}}])。

假设检验:判断数据是否支持某个假设。设定零假设 H0H_0 和备择假设 H1H_1,计算检验统计量,根据p值做出决策。p值是在 H0H_0 为真的假设下,观察到当前或更极端数据的概率。

回归分析:建立因变量与自变量之间的关系模型。线性回归 Y=β0+β1X+εY = \beta_0 + \beta_1 X + \varepsilon 是最基本的形式。

历史演变

统计学的起源可追溯到17世纪格朗特(John Graunt)对伦敦死亡率表的研究。贝叶斯定理(1763年发表)是贝叶斯统计的基础。拉普拉斯和高斯在18—19世纪发展了最小二乘法和正态分布理论。

现代统计学在20世纪初由三位巨匠奠定基础:卡尔·皮尔逊(Karl Pearson)发展了卡方检验和相关分析;罗纳德·费舍尔(Ronald Fisher)发展了最大似然估计、方差分析和实验设计;杰西·奈曼(Jerzy Neyman)和埃贡·皮尔逊(Egon Pearson)发展了假设检验的数学理论。

频率学派和贝叶斯学派的争论贯穿了20世纪统计学的历史。频率学派将概率理解为长期频率,贝叶斯学派将概率理解为信念程度。当代统计学中,两种方法各有优势。

关键人物

费舍尔(1890—1962)是现代统计学的奠基人之一。他发展了最大似然估计、方差分析(ANOVA)、F分布和实验设计的理论。他的著作《研究者的统计方法》(1925)至今仍是统计学的经典教材。

皮尔逊(1857—1936)是英国统计学家,伦敦大学学院统计学系的创始人。他发展了卡方检验、相关系数和矩估计法。

数学意义

统计学的数学基础:

  1. 中心极限定理:正态分布的普遍性——大样本推断的基础
  2. 最大似然估计:选择使观测数据最可能的参数值
  3. 克拉美-罗下界:无偏估计的方差下界
  4. 贝叶斯定理P(θD)=P(Dθ)P(θ)P(D)P(\theta|D) = \frac{P(D|\theta)P(\theta)}{P(D)}——将先验信念与数据结合
  5. 线性模型理论:最小二乘估计、高斯-马尔可夫定理

描述统计与推断统计

描述统计:用数值和图表总结数据的特征。集中趋势指标包括均值 xˉ=1nxi\bar{x} = \frac{1}{n}\sum x_i、中位数和众数。离散程度指标包括方差 s2=1n1(xixˉ)2s^2 = \frac{1}{n-1}\sum(x_i - \bar{x})^2、标准差和四分位距。分布形状指标包括偏度和峰度。

推断统计:从样本推断总体的性质。核心问题:(1) 参数估计——用样本统计量估计总体参数;(2) 假设检验——判断数据是否支持某假设;(3) 预测——对未观测数据做出推断。

抽样分布:样本统计量(如 Xˉ\bar{X})本身是随机变量,其分布称为抽样分布。中心极限定理保证:当 $n$ 足够大时,XˉN(μ,σ2/n)\bar{X} \sim N(\mu, \sigma^2/n)

假设检验与 p 值

假设检验框架(Neyman-Pearson):设定 H0H_0(零假设)和 H1H_1(备择假设),选择检验统计量 $T$,确定拒绝域。两类错误:I 类错误(α\alpha)——H0H_0 为真时拒绝;II 类错误(β\beta)——H0H_0 为假时不拒绝。检验功效 =1β= 1 - \beta

p 值:在 H0H_0 为真的假设下,观察到当前或更极端数据的概率。p=P(TtobsH0)p = P(T \geq t_{\text{obs}} \mid H_0)。p 值不是 H0H_0 为真的概率——这是常见的误解。

显著性水平 α\alpha:预先设定的阈值(通常 $0.05$)。若 p<αp < \alpha,拒绝 H0H_0。注意:$p = 0.04$$p = 0.06$ 的实际差异很小——不应机械地以 $0.05$ 为分界线。

置信区间

置信区间:参数 θ\theta1α1-\alpha 置信区间 $[L, U]$ 满足 P(θ[L,U])=1αP(\theta \in [L, U]) = 1-\alpha——在重复抽样中,95%95\% 的置信区间会覆盖真实参数值。

均值的置信区间:已知方差时,xˉ±zα/2σn\bar{x} \pm z_{\alpha/2} \frac{\sigma}{\sqrt{n}};未知方差时,xˉ±tα/2,n1sn\bar{x} \pm t_{\alpha/2, n-1} \frac{s}{\sqrt{n}}

常见误解:95% 置信区间不是参数有 95% 的概率落在区间内(参数是固定的,区间是随机的)。

贝叶斯统计

贝叶斯定理P(θD)=P(Dθ)P(θ)P(D)P(\theta \mid D) = \frac{P(D \mid \theta) P(\theta)}{P(D)}。后验 \propto 似然 ×\times 先验。

先验分布 P(θ)P(\theta):在看到数据之前对参数的信念。似然 P(Dθ)P(D \mid \theta):数据对参数的支持程度。后验分布 P(θD)P(\theta \mid D):结合先验和数据后的更新信念。

贝叶斯 vs 频率学派:频率学派将 θ\theta 视为固定未知常数,用置信区间描述不确定性;贝叶斯学派将 θ\theta 视为随机变量,用后验分布描述不确定性。贝叶斯方法的优势在于自然地融入先验知识、直接给出参数的概率陈述;劣势在于先验选择的主观性和计算复杂性。

共轭先验:若先验和后验属于同一分布族,则称先验为共轭先验。例如正态分布的均值的共轭先验是正态分布,伯努利参数的共轭先验是 Beta 分布。

回归分析与因果推断

线性回归Y=Xβ+εY = X\beta + \varepsilon,最小二乘估计 β^=(XTX)1XTY\hat{\beta} = (X^T X)^{-1} X^T Y。高斯-马尔可夫定理:在经典假设下,β^\hat{\beta} 是最佳线性无偏估计(BLUE)。

正则化:当特征数多于样本数或存在多重共线性时,引入惩罚项。岭回归(L2):β^=argminYXβ2+λβ2\hat{\beta} = \arg\min \|Y - X\beta\|^2 + \lambda\|\beta\|^2。LASSO(L1):β^=argminYXβ2+λβ1\hat{\beta} = \arg\min \|Y - X\beta\|^2 + \lambda\|\beta\|_1——自动进行特征选择。

因果推断:相关不等于因果。随机对照试验(RCT)是因果推断的金标准——随机分配处理消除了混杂因素。观察性研究中,工具变量法、断点回归和双重差分法是常用的因果推断策略。珀尔(Judea Pearl)的结构因果模型和 do-演算提供了形式化的因果推理框架。

多重检验与错误发现率

多重检验问题:同时检验 $m$ 个假设时,I 类错误的概率急剧增加。$P(\text{至少一个假阳性}) = 1 - (1-\alpha)^m$——当 m=100,α=0.05m=100, \alpha=0.05 时约为 $0.994$

Bonferroni 校正:将显著性水平设为 α/m\alpha/m,控制族系误差率(FWER)。过于保守——在 $m$ 很大时几乎无法拒绝任何假设。

错误发现率(FDR):Benjamini-Hochberg 程序控制 FDR——在所有被拒绝的假设中,假发现的期望比例不超过 $q$。这在基因组学等高维数据分析中更为实用。

经验贝叶斯:从数据中估计先验分布——在多重检验中,经验贝叶斯方法(如 Efron 的 local fdr)比传统校正方法更有效地利用了信息。

贝叶斯网络:用有向无环图表示变量之间的条件独立关系。联合分布分解为 P(X1,,Xn)=i=1nP(XiPa(Xi))P(X_1, \ldots, X_n) = \prod_{i=1}^n P(X_i \mid \text{Pa}(X_i))——这使得高维推断变得可行。

核心概念辨析

  • 描述统计 vs 推断统计:描述统计总结数据,推断统计从样本推断总体
  • 频率学派 vs 贝叶斯学派:频率学派用置信区间,贝叶斯学派用后验分布
  • p值 vs 效应量:p值衡量统计显著性,效应量衡量实际重要性
  • 相关 vs 因果:相关不蕴含因果——因果推断需要额外假设

当代应用

统计学在现代社会中无处不在。临床试验的统计设计确保药物的有效性和安全性;社会科学用调查分析和因果推断理解社会现象;A/B测试指导产品决策;基因组学用多重检验校正和关联分析寻找疾病基因;环境科学用空间统计和时间序列分析做气候预测;机器学习则把统计学习理论当作模型选择和泛化分析的基础。

跨域连接

  • 复制危机:把 0.05 当成发表的门槛,等于给研究者一个在分析路径中挑显著结果的诱因。机制很直白:同一批数据可做的分析越多,撞出显著的概率越高。推论是预注册应当系统性压低已发表的效应量,而这正是大规模重复项目观察到的方向;它同时预测重复失败会集中在效应量最小的那些领域。
  • 预注册与注册报告:在看数据前锁死假设与分析方案,等于把研究者自由度从推断里剥离出去。可检验后果是注册报告里阴性结果的比例明显更高——因为发表与否不再取决于结果好不好看,而取决于问题和设计是否重要。
  • 中心极限定理:绝大多数 t 检验与置信区间的合法性来自样本均值的渐近正态性,而非数据本身正态。这条依赖在小样本和重尾数据上最先失效,也正是低功效研究给出的显著结果最不值得相信的技术原因;样本量估算若照搬正态假设,功效同样会被高估。
  • 流行病学:全基因组关联与亚组分析动辄成千上万次检验,不做错误发现率控制几乎必然刷出假阳性。推论是显著性阈值必须随检验数收紧,否则"新发现"的期望数量由检验次数而不是由生物学决定。
  • 计量经济学基础:标准误的公式依赖误差独立同分布,个体在同一地区或同一学校内的相关会让它被系统性低估。后果是政策评估文献里大量"显著"结论来自被低估的不确定性,聚类稳健标准误普及后,相当一批旧结果被重新讨论——"结论稳健"因此必须指明是对哪一类相关稳健。

为什么这很重要

统计学是科学方法的数学引擎——没有它,就无法从数据中提取可靠的结论。从药物审批到天气预报,从质量控制到社会调查,统计学支撑着现代社会的决策过程。

可重复性危机与统计实践。2010年代,心理学、医学和社会科学遭遇了"可重复性危机"——许多已发表的研究结果无法被重复。核心原因之一是p值的滥用:p-hacking(反复调整分析直到p<0.05)、发表偏差(只发表显著结果)和样本量不足。这一危机推动了统计实践的改革:预注册研究、效应量报告、贝叶斯方法的推广和开放数据。美国统计学会(ASA)在2016年发表了关于p值的正式声明——强调"p值不能衡量假设为真的概率"。

因果推断革命。珀尔(Judea Pearl)和鲁宾(Donald Rubin)发展了不同的因果推断框架。珀尔的结构因果模型用有向无环图(DAG)表示因果关系,do-演算提供了从观察数据推断因果效应的形式化规则。"相关不等于因果"是统计学的基本教训——但因果推断理论告诉我们,在什么条件下可以从相关推断因果。辛普森悖论就是一个警示:在每个子群体中成立的趋势在合并数据中可能反转——忽略混杂变量会导致错误的因果结论。

统计学与机器学习的融合

统计学习理论为机器学习提供了数学基础。偏差-方差权衡(bias-variance tradeoff)解释了模型复杂度与泛化能力的关系:复杂模型偏差低但方差高,简单模型偏差高但方差低。VC维(Vapnik-Chervonenkis dimension)量化了模型类的容量——VC维越高,模型能拟合越复杂的模式,但也越容易过拟合。

正则化理论将统计先验与优化结合:岭回归对应高斯先验,LASSO对应拉普拉斯先验。交叉验证是模型选择的实用工具——留一法交叉验证与AIC(赤池信息准则)有深刻的联系。贝叶斯模型比较自动实现了奥卡姆剃刀——复杂模型被先验惩罚。

常见误区

  • "p<0.05意味着结果是真的":p值衡量的是数据与零假设的兼容性,不是假设为真的概率。p=0.04意味着"如果零假设为真,观察到当前或更极端数据的概率是4%"——这与"假设为真的概率是96%"完全不同。
  • "大样本总是更好的":大样本提高了统计功效,但也可能检测到"统计显著但实际微不足道"的效应。效应量(effect size)比p值更能反映结果的实际重要性。
  • "相关不意味着因果"就永远不能推断因果:在适当的假设下(如无混杂假设),观察性研究可以推断因果。工具变量法、断点回归和双重差分法都是从观察数据推断因果的合法方法。

统计学的实践智慧

统计学不仅是一套数学工具,更是一种思维方式。好的统计实践包括:在收集数据之前确定分析计划(避免p-hacking);报告效应量和置信区间而不仅仅是p值;考虑结果的实际重要性而不仅仅是统计显著性;在可能的情况下用贝叶斯方法融入先验知识;公开数据和代码以允许重复验证。费舍尔有一句广为流传的告诫:实验做完才来找统计学家,往往无异于请他做一场尸检——这提醒我们,统计设计应在数据收集之前就介入,而非事后补救。

参考文献

  1. Ronald A. Fisher, Statistical Methods for Research Workers (1925).
  2. Jerzy Neyman & Egon Pearson, "On the Problem of the Most Efficient Tests" (1933).
  3. E.L. Lehmann & George Casella, Theory of Point Estimation (1998).
  4. 陈家鼎, 孙山泽, 《数理统计学讲义》, 高等教育出版社, 2006.
  5. Larry Wasserman, All of Statistics (2004).

统计学研究如何从数据中推断与决策。描述统计概括数据特征,推断统计用样本估计总体并检验假设(置信区间、p 值),回归分析建模变量关系;它是科学实验、医学试验与数据科学的方法论基础。

交互式可视化

概率分布探索器

交互式探索正态、均匀、指数和二项分布,拖动参数观察形态变化

打开探索器 →