置信区间描述估计的不确定性,功效分析则在研究设计阶段连接效应大小、样本量和错误率。两者共同回答:结果有多精确,以及研究是否有能力发现目标效应。
置信区间的含义
95% 置信区间是一套重复抽样程序的产物:如果重复相同研究并每次计算区间,长期来看约 95% 的区间会覆盖真实参数。
在频率学派解释下,它不表示“参数有 95% 概率位于这一个已经算出的区间中”。
区间提供三类信息:
- 点估计附近有哪些参数值与数据相容;
- 估计方向和可能范围;
- 研究精度是否足以支持实际决策。
置信水平与宽度
在其他条件相同时:
- 置信水平越高,区间越宽;
- 样本量越大,区间通常越窄;
- 数据变异越大,区间通常越宽。
set.seed(123)
x <- rnorm(50, mean = 100, sd = 15)
t.test(x, conf.level = 0.90)$conf.int
t.test(x, conf.level = 0.95)$conf.int
t.test(x, conf.level = 0.99)$conf.int
常见参数的区间
均值的 t 区间:
t.test(x, conf.level = 0.95)$conf.int
二项比例可使用精确或近似方法:
binom.test(7, 20, conf.level = 0.95)$conf.int
prop.test(7, 20, conf.level = 0.95, correct = FALSE)$conf.int
精确区间基于离散分布,覆盖率通常至少达到设定水平,但可能更宽;近似区间依赖大样本性质,小样本或极端比例下应更谨慎。
方差和标准差的区间可以利用卡方分布:
n <- length(x)
s2 <- var(x)
alpha <- 0.05
variance_ci <- c(
(n - 1) * s2 / qchisq(1 - alpha / 2, n - 1),
(n - 1) * s2 / qchisq(alpha / 2, n - 1)
)
sqrt(variance_ci)
区间方法必须匹配参数、抽样设计和模型假设,不能只选择最窄的一种。
统计功效
统计功效定义为:真实效应存在时,检验正确拒绝 的概率。
其中 是 II 型错误率。功效不足意味着即使效应真实存在,研究也很容易得到“不显著”。
影响功效的主要因素包括:
| 因素 | 对功效的典型影响 |
|---|---|
| 效应更大 | 更容易识别,功效提高 |
| 样本量更大 | 标准误降低,功效提高 |
| 数据变异更小 | 信号相对更清楚,功效提高 |
| 更严格 | 更难拒绝 ,功效降低 |
| 配对或高效设计 | 减少无关变异,功效可能提高 |
效应大小
两组均值比较常使用 Cohen's d:
查看图片Cohen's d 示意

0.2、0.5、0.8 常被称为小、中、大效应,但设计研究时应优先使用领域中具有实际意义的最小效应,而不是机械套用经验标签。
library(effsize)
library(palmerpenguins)
cohen.d(flipper_length_mm ~ sex, data = penguins)
已知样本量时计算功效
library(pwr)
pwr.t.test(
n = 30,
d = 0.5,
sig.level = 0.05,
type = "two.sample",
alternative = "two.sided"
)
这里的 n 是每组样本量。在该设定下,功效约为 0.48,意味着研究很可能错过真实的中等效应。
根据目标功效估计样本量
pwr.t.test(
d = 0.5,
power = 0.8,
sig.level = 0.05,
type = "two.sample",
alternative = "two.sided"
)
返回的每组样本量约为 64。实际设计还应考虑失访、缺失、组间分配比例、聚类结构和主要分析模型。
功效计算不是在几个参数之间寻找最方便的组合。效应大小应来自先验研究或实际意义, 应由错误代价决定,设计参数也应与最终分析一致。