什么时候用它
两个数值变量看散点图就够了。但 10 个变量有 45 对关系,30 个变量有 435 对——逐一画散点做不到。
相关性热图把所有两两相关系数压进一个矩阵,用颜色表达方向和强度。它是探索入口,不是结论:先用它发现哪里可能有结构,再回到具体变量对上画散点、查离群点、做模型。
怎么读
- 先看方向。 一端是负相关、另一端是正相关,中间色接近 0。
- 再看深浅。 越深,相关系数绝对值越大。
- 看色块。 聚类排序后相似的变量被排到一起,会出现连续的块状结构。
- 看星号。 它说的是"在这个样本量下相关性是否显著偏离 0",不是效应大小。强相关看颜色,显著性看星号,两件事。
- 回到散点图。 对最要紧的那几对变量,一定要再画散点确认——热图只压缩,不解释。
以 mtcars 为例:mpg 和 wt、disp、hp、cyl 明显负相关。这不能直接读成"重量导致油耗降低",只能说这组变量和燃油效率有系统性的反向变化。
常见陷阱
- 相关不是因果。 一起变化不说明谁导致谁。
- Pearson 只看线性。 非线性关系可能相关系数很低,但散点图上明显有规律。
- 离群点能主导结果。 一个极端点就可能显著改变系数和 p 值。
- 样本量小时都不稳。 系数和 p 值都会跳。
- 检验多了星号就多。 30 个变量是 435 次检验,星号需要谨慎解读。
- 聚类只是描述。 它帮你读结构,不等于发现了机制。
配色
相关系数有明确方向,所以必须用发散配色:一端是负相关、另一端是正相关,而中性的那一档必须正好落在 0 上。锚点偏了,读者会把"没关系"读成"弱正相关"——这是配色能造成的最实质的一种误读。
上面用的是 walter_white(冷蓝 → 冷白 → 深橄榄)。换成红蓝也行,关键不是挑哪两个色,而是读者能不能一眼分清负、零、正三个位置。

