01统计推断、假设检验与 p 值

从频率学派、贝叶斯与预测视角出发,理解零假设、检验统计量、错误类型和 p 值的解释边界。

2025-07-30
StatisticsInferenceHypothesis TestingP Value
本章目录 · 9

统计分析首先要明确目标:是估计未知参数、检验一个科学假设,还是在新数据上获得准确预测。不同目标会采用不同的证据表达方式。

三种常见视角

视角 参数与概率 主要产物 典型问题
频率学派 参数固定未知,数据来自可重复的随机过程 点估计、置信区间、p 值 如果零假设成立,这些数据有多反常?
贝叶斯学派 参数的不确定性用概率分布表示 后验分布、可信区间、后验概率 结合先验与数据后,参数可能在哪里?
机器学习 重点通常是泛化和预测表现 预测、误差、交叉验证结果 模型在未见数据上表现如何?

这些不是互斥的工具箱。研究可以用统计模型解释参数,同时用留出数据检查预测;贝叶斯模型也可以服务于预测。选择方法取决于问题、研究设计和希望报告的证据。

本系列后续检验主要采用频率学派框架。

零假设与备择假设

零假设 H0H_0 通常表示没有差异、没有效应或没有关联;备择假设 H1H_1 表示存在研究关心的差异或关联。

例如,比较两组平均血压:

H0:μ1μ2=0H_0: \mu_1 - \mu_2 = 0 H1:μ1μ20H_1: \mu_1 - \mu_2 \ne 0

检验并不直接“证明 H1H_1”。它问的是:如果 H0H_0 成立,当前数据及更极端的数据是否足够罕见?

  • 拒绝 H0H_0:数据与 H0H_0 的相容性较低;
  • 未拒绝 H0H_0:证据不足,不能据此证明 H0H_0 为真。

检验统计量

检验统计量把样本与零假设预期之间的偏离压缩成一个数:

统计量 常见方法 典型用途
t t 检验 比较均值
χ2\chi^2 卡方检验 分类变量与拟合优度
F ANOVA 比较多个均值或模型
z 大样本检验、GLM 标准化估计与标准误

统计量的大小必须结合它在 H0H_0 下的参考分布、自由度和检验方向解释。

显著性水平与两类错误

显著性水平 α\alpha 在分析前设定,它控制长期重复实验中错误拒绝真实 H0H_0 的风险。

真实状态 拒绝 H0H_0 未拒绝 H0H_0
H0H_0 为真 I 型错误,概率受 α\alpha 控制 正确决定
H1H_1 为真 正确发现 II 型错误,概率为 β\beta

功效为 1β1-\beta。在样本量和效应大小固定时,降低 α\alpha 通常减少假阳性,却增加假阴性。这个权衡不能靠事后移动阈值解决。

p 值是什么

p 值是在 H0H_0 及所用模型假设成立时,观察到当前统计量或更极端统计量的概率。

它不是:

  • H0H_0 为真的概率;
  • 结果由偶然造成的概率;
  • 效应大小;
  • 研究能够重复成功的概率。

大样本可以让很小的效应获得很小的 p 值,小样本也可能让重要效应无法达到阈值。因此报告结果时应同时给出效应估计、置信区间、样本量和研究设计。

一套基本检验流程

  1. 用科学问题定义参数与目标总体;
  2. 在看结果前写明 H0H_0H1H_1 和检验方向;
  3. 根据结局类型、研究设计和依赖结构选择方法;
  4. 检查检验所需假设;
  5. 计算统计量、p 值、效应估计和区间;
  6. 结合实际意义解释,不只判断是否越过 0.05;
  7. 报告所有预先定义的分析,并区分探索性分析。

单侧还是双侧

双侧检验关注任一方向的差异;单侧检验只关注预先指定的方向。

双侧:H1: μ1 - μ2 ≠ 0
单侧:H1: μ1 - μ2 > 0

单侧检验必须由研究问题在查看数据前决定。观察到结果方向后再改成单侧,会人为缩小 p 值。

R 中的一个例子

比较企鹅雌雄鳍状肢长度:

library(palmerpenguins)

result <- t.test(
  flipper_length_mm ~ sex,
  data = penguins
)

result$statistic
result$p.value
result$estimate
result$conf.int

这段输出应作为一个整体阅读:t 统计量描述标准化偏离,p 值描述与零假设的相容性,组均值与置信区间则说明效应方向、大小和不确定性。

女士品茶:随机化与精确检验

女士品茶实验将 8 杯茶随机排列,其中 4 杯先加牛奶、4 杯先加茶。若参与者全部分类正确,在随机猜测下对应组合的概率为 1/701/70

tea <- matrix(
  c(4, 0, 0, 4),
  nrow = 2,
  dimnames = list(
    actual = c("milk-first", "tea-first"),
    guess = c("milk-first", "tea-first")
  )
)

fisher.test(tea, alternative = "greater")

这个例子体现了三个重点:实验的随机化定义了零假设分布;小样本可使用精确检验;检验方向必须对应预先提出的问题。

统计显著性只是证据链的一部分。可靠结论还依赖研究设计、测量质量、效应大小、模型假设和透明报告。