统计分析首先要明确目标:是估计未知参数、检验一个科学假设,还是在新数据上获得准确预测。不同目标会采用不同的证据表达方式。
三种常见视角
| 视角 | 参数与概率 | 主要产物 | 典型问题 |
|---|---|---|---|
| 频率学派 | 参数固定未知,数据来自可重复的随机过程 | 点估计、置信区间、p 值 | 如果零假设成立,这些数据有多反常? |
| 贝叶斯学派 | 参数的不确定性用概率分布表示 | 后验分布、可信区间、后验概率 | 结合先验与数据后,参数可能在哪里? |
| 机器学习 | 重点通常是泛化和预测表现 | 预测、误差、交叉验证结果 | 模型在未见数据上表现如何? |
这些不是互斥的工具箱。研究可以用统计模型解释参数,同时用留出数据检查预测;贝叶斯模型也可以服务于预测。选择方法取决于问题、研究设计和希望报告的证据。
本系列后续检验主要采用频率学派框架。
零假设与备择假设
零假设 通常表示没有差异、没有效应或没有关联;备择假设 表示存在研究关心的差异或关联。
例如,比较两组平均血压:
检验并不直接“证明 ”。它问的是:如果 成立,当前数据及更极端的数据是否足够罕见?
- 拒绝 :数据与 的相容性较低;
- 未拒绝 :证据不足,不能据此证明 为真。
检验统计量
检验统计量把样本与零假设预期之间的偏离压缩成一个数:
| 统计量 | 常见方法 | 典型用途 |
|---|---|---|
| t | t 检验 | 比较均值 |
| 卡方检验 | 分类变量与拟合优度 | |
| F | ANOVA | 比较多个均值或模型 |
| z | 大样本检验、GLM | 标准化估计与标准误 |
统计量的大小必须结合它在 下的参考分布、自由度和检验方向解释。
显著性水平与两类错误
显著性水平 在分析前设定,它控制长期重复实验中错误拒绝真实 的风险。
| 真实状态 | 拒绝 | 未拒绝 |
|---|---|---|
| 为真 | I 型错误,概率受 控制 | 正确决定 |
| 为真 | 正确发现 | II 型错误,概率为 |
功效为 。在样本量和效应大小固定时,降低 通常减少假阳性,却增加假阴性。这个权衡不能靠事后移动阈值解决。
p 值是什么
p 值是在 及所用模型假设成立时,观察到当前统计量或更极端统计量的概率。
它不是:
- 为真的概率;
- 结果由偶然造成的概率;
- 效应大小;
- 研究能够重复成功的概率。
大样本可以让很小的效应获得很小的 p 值,小样本也可能让重要效应无法达到阈值。因此报告结果时应同时给出效应估计、置信区间、样本量和研究设计。
一套基本检验流程
- 用科学问题定义参数与目标总体;
- 在看结果前写明 、 和检验方向;
- 根据结局类型、研究设计和依赖结构选择方法;
- 检查检验所需假设;
- 计算统计量、p 值、效应估计和区间;
- 结合实际意义解释,不只判断是否越过 0.05;
- 报告所有预先定义的分析,并区分探索性分析。
单侧还是双侧
双侧检验关注任一方向的差异;单侧检验只关注预先指定的方向。
双侧:H1: μ1 - μ2 ≠ 0
单侧:H1: μ1 - μ2 > 0
单侧检验必须由研究问题在查看数据前决定。观察到结果方向后再改成单侧,会人为缩小 p 值。
R 中的一个例子
比较企鹅雌雄鳍状肢长度:
library(palmerpenguins)
result <- t.test(
flipper_length_mm ~ sex,
data = penguins
)
result$statistic
result$p.value
result$estimate
result$conf.int
这段输出应作为一个整体阅读:t 统计量描述标准化偏离,p 值描述与零假设的相容性,组均值与置信区间则说明效应方向、大小和不确定性。
女士品茶:随机化与精确检验
女士品茶实验将 8 杯茶随机排列,其中 4 杯先加牛奶、4 杯先加茶。若参与者全部分类正确,在随机猜测下对应组合的概率为 。
tea <- matrix(
c(4, 0, 0, 4),
nrow = 2,
dimnames = list(
actual = c("milk-first", "tea-first"),
guess = c("milk-first", "tea-first")
)
)
fisher.test(tea, alternative = "greater")
这个例子体现了三个重点:实验的随机化定义了零假设分布;小样本可使用精确检验;检验方向必须对应预先提出的问题。
统计显著性只是证据链的一部分。可靠结论还依赖研究设计、测量质量、效应大小、模型假设和透明报告。