概率分布描述随机变量可能取哪些值,以及这些值出现的相对可能性。统计检验、置信区间和模拟都建立在分布之上。
R 的 d、p、q、r 约定
多数分布都提供四类函数:
| 前缀 | 返回内容 | 正态分布示例 |
|---|---|---|
d |
密度或概率质量 | dnorm() |
p |
累积分布概率 | pnorm() |
q |
给定概率对应的分位数 | qnorm() |
r |
随机抽样 | rnorm() |
dnorm(0)
pnorm(1.96)
qnorm(0.975)
rnorm(5, mean = 0, sd = 1)
这个命名规则也适用于 dt()、pbinom()、qchisq()、rf() 等函数。
分布选择速查
| 分布 | 类型 | 关键参数 | 常见用途 |
|---|---|---|---|
| 正态 | 连续 | 均值、标准差 | 测量误差、均值近似 |
| t | 连续 | 自由度 | 均值推断、回归系数 |
| 二项 | 离散 | 试验次数、成功概率 | 固定次数中的成功数 |
| 泊松 | 离散 | 事件率 | 固定暴露量中的计数 |
| 指数 | 连续 | 事件率 | 泊松过程的等待时间 |
| 均匀 | 连续 | 下限、上限 | 区间内等可能抽样 |
| 卡方 | 连续 | 自由度 | 方差、列联表、拟合优度 |
| F | 连续 | 两个自由度 | 方差比、ANOVA、模型比较 |
正态分布
正态分布由均值和标准差决定,关于均值对称:
set.seed(123)
x <- rnorm(1000, mean = 0, sd = 1)
查看图片正态分布

样本看起来近似钟形并不自动满足所有统计假设。检验通常关心误差或残差分布,而不一定要求原始变量本身正态。
t 分布
t 分布同样对称,但尾部比正态分布更厚。自由度增加时逐渐接近标准正态分布:
x <- rt(1000, df = 5)
qt(0.975, df = 5)
查看图片t 分布

它用于总体标准差未知时的均值推断,也是线性模型系数检验的重要参考分布。
二项分布
二项分布描述固定 次独立试验中的成功次数,每次成功概率为 :
x <- rbinom(1000, size = 10, prob = 0.5)
dbinom(5, size = 10, prob = 0.5)
pbinom(5, size = 10, prob = 0.5)
查看图片二项分布

典型例子包括 20 位受试者中的应答人数,或一批产品中的合格数量。
泊松分布
泊松分布描述固定时间、空间或暴露量内的事件数:
x <- rpois(1000, lambda = 3)
dpois(2, lambda = 3)
查看图片泊松分布

lambda 同时决定均值和方差。实际计数数据若方差明显更大,可能存在过度离散,需要其他模型。
指数分布
指数分布描述恒定事件率的泊松过程中的等待时间:
x <- rexp(1000, rate = 2)
pexp(1, rate = 2)
查看图片指数分布

它具有无记忆性;如果事件风险随时间变化,指数分布可能不适合。
均匀分布
连续均匀分布让区间内任意等宽区域具有相同概率:
x <- runif(1000, min = 0, max = 1)
查看图片均匀分布

它常用于随机数生成和模拟中的基础抽样。
卡方分布
卡方分布只取非负值,自由度决定形状:
x <- rchisq(1000, df = 5)
qchisq(c(0.025, 0.975), df = 5)
查看图片卡方分布

它出现在总体方差推断、分类数据检验和拟合优度检验中。
F 分布
F 分布是两个经自由度缩放的卡方变量之比,同样只取非负值:
x <- rf(1000, df1 = 5, df2 = 10)
qf(0.95, df1 = 5, df2 = 10)
查看图片F 分布

ANOVA 使用 F 统计量比较组间与组内变异;嵌套模型比较也常出现 F 检验。
模拟、概率与分位数是不同问题
- “随机生成 100 个观测”使用
r*(); - “某个值附近的密度或概率”使用
d*(); - “不超过某值的概率”使用
p*(); - “95% 分位点在哪里”使用
q*()。
选择分布不能只看直方图形状,还要对应数据生成机制、取值范围、独立性和参数含义。