什么时候用它
箱线图用五个视觉部件压缩一组连续数据:中位数、上下四分位数、两条须,以及落在须外的点。它适合并排比较多个组的位置与离散程度,比均值柱保留的信息更多,也比小提琴图更少依赖分布估计。
每组只有十来个观测时,箱体仍能提供紧凑摘要,但几个分位数会被单个点明显影响。因此小样本箱线图最好叠加全部原始点;读者既能快速比较箱体,也能看见究竟有多少数据支撑它。
如果关心双峰、偏态尾部或完整密度形状,使用小提琴图或密度图;如果只展示一个估计值与不确定性,使用点估计加误差棒。箱线图不是所有“组间比较”的默认答案。
箱体和须分别是什么
- 箱体下边缘是 Q1,上边缘是 Q3。 中间 50% 的数据落在箱体内。
- 箱体高度是 IQR = Q3 − Q1。 箱体越高,中间一半数据越分散。
- 箱内横线是中位数。 它不是均值;偏态数据里两者可以相差很远。
- 须不是固定的最小值和最大值。 下须延伸到不低于
Q1 − 1.5 × IQR的最小观测,上须延伸到不高于Q3 + 1.5 × IQR的最大观测。 - 须外的点是规则标出的潜在异常值。 它们不一定错误,也不能因为被标出就删除。
围栏 Q1 ± 1.5 × IQR 只是判定界限,须端落在真实观测值上,并不一定正好等于围栏位置。
常见陷阱
- 样本太少却只画箱体。
n = 5也能算四分位,但一个整齐箱子会制造过度稳定的印象;叠加原始点。 - 把须读成最小最大值。 ggplot2 默认使用 1.5 × IQR 规则,须外仍可能有真实观测。
- 叠点后异常值画两遍。
geom_boxplot()默认单独画须外点,再叠全部原始点会重复;应设outlier.shape = NA。 - 纵向抖动。 原始点只能沿分类轴轻微移动;纵向抖动会篡改真实数值。
- 颜色和形状同时分组。 常规分组箱线图只用颜色;再给每组一种点形会增加没有新信息的图例负担。
- 隐藏样本量。 同样大小的箱体可能来自 10 个点或 1000 个点;在轴标签或图注中标明
n。 - 用箱线图证明正态。 对称箱体不等于正态分布,箱线图也不足以判断分布假设。
- 轴范围裁掉须外点。
scale_y_continuous(limits = ...)会在统计前删除范围外数据;只想放大视图时使用coord_cartesian()。
配色
处理组是无序类别,使用定性色板 walter_white2。箱体用半透明填色和统一深色边框,原始点沿用同一组颜色与同一种圆形;颜色只解释组别一次。
箱线图中的颜色面积比散点大,因此浅色很容易显得发白,深色又可能压住中位数线。保留深色轮廓与适度透明度,比单纯加深所有颜色更稳。色板不足组数时,不循环颜色,也不删除数据;未编码组使用明确的中性色。



