03常见统计分布与 R 函数

认识正态、t、二项、泊松、指数、均匀、卡方和 F 分布,并掌握 R 中 d、p、q、r 函数族。

2025-08-05
StatisticsProbability DistributionsRSimulation
本章目录 · 11

概率分布描述随机变量可能取哪些值,以及这些值出现的相对可能性。统计检验、置信区间和模拟都建立在分布之上。

R 的 dpqr 约定

多数分布都提供四类函数:

前缀 返回内容 正态分布示例
d 密度或概率质量 dnorm()
p 累积分布概率 pnorm()
q 给定概率对应的分位数 qnorm()
r 随机抽样 rnorm()
dnorm(0)
pnorm(1.96)
qnorm(0.975)
rnorm(5, mean = 0, sd = 1)

这个命名规则也适用于 dt()pbinom()qchisq()rf() 等函数。

分布选择速查

分布 类型 关键参数 常见用途
正态 连续 均值、标准差 测量误差、均值近似
t 连续 自由度 均值推断、回归系数
二项 离散 试验次数、成功概率 固定次数中的成功数
泊松 离散 事件率 固定暴露量中的计数
指数 连续 事件率 泊松过程的等待时间
均匀 连续 下限、上限 区间内等可能抽样
卡方 连续 自由度 方差、列联表、拟合优度
F 连续 两个自由度 方差比、ANOVA、模型比较

正态分布

正态分布由均值和标准差决定,关于均值对称:

set.seed(123)
x <- rnorm(1000, mean = 0, sd = 1)
查看图片正态分布
正态分布

样本看起来近似钟形并不自动满足所有统计假设。检验通常关心误差或残差分布,而不一定要求原始变量本身正态。

t 分布

t 分布同样对称,但尾部比正态分布更厚。自由度增加时逐渐接近标准正态分布:

x <- rt(1000, df = 5)
qt(0.975, df = 5)
查看图片t 分布
t 分布

它用于总体标准差未知时的均值推断,也是线性模型系数检验的重要参考分布。

二项分布

二项分布描述固定 nn 次独立试验中的成功次数,每次成功概率为 pp

x <- rbinom(1000, size = 10, prob = 0.5)
dbinom(5, size = 10, prob = 0.5)
pbinom(5, size = 10, prob = 0.5)
查看图片二项分布
二项分布

典型例子包括 20 位受试者中的应答人数,或一批产品中的合格数量。

泊松分布

泊松分布描述固定时间、空间或暴露量内的事件数:

x <- rpois(1000, lambda = 3)
dpois(2, lambda = 3)
查看图片泊松分布
泊松分布

lambda 同时决定均值和方差。实际计数数据若方差明显更大,可能存在过度离散,需要其他模型。

指数分布

指数分布描述恒定事件率的泊松过程中的等待时间:

x <- rexp(1000, rate = 2)
pexp(1, rate = 2)
查看图片指数分布
指数分布

它具有无记忆性;如果事件风险随时间变化,指数分布可能不适合。

均匀分布

连续均匀分布让区间内任意等宽区域具有相同概率:

x <- runif(1000, min = 0, max = 1)
查看图片均匀分布
均匀分布

它常用于随机数生成和模拟中的基础抽样。

卡方分布

卡方分布只取非负值,自由度决定形状:

x <- rchisq(1000, df = 5)
qchisq(c(0.025, 0.975), df = 5)
查看图片卡方分布
卡方分布

它出现在总体方差推断、分类数据检验和拟合优度检验中。

F 分布

F 分布是两个经自由度缩放的卡方变量之比,同样只取非负值:

x <- rf(1000, df1 = 5, df2 = 10)
qf(0.95, df1 = 5, df2 = 10)
查看图片F 分布
F 分布

ANOVA 使用 F 统计量比较组间与组内变异;嵌套模型比较也常出现 F 检验。

模拟、概率与分位数是不同问题

  • “随机生成 100 个观测”使用 r*()
  • “某个值附近的密度或概率”使用 d*()
  • “不超过某值的概率”使用 p*()
  • “95% 分位点在哪里”使用 q*()

选择分布不能只看直方图形状,还要对应数据生成机制、取值范围、独立性和参数含义。