Folioevanzhou.org
← 返回 Tessera
原样150 行 × 5 列4 KB无缺失数据 2026-08-11

iris

Four continuous flower measurements for 150 specimens across three iris species.

One row represents one flower.

R package · 收录于 2026-08-11

下载 CSV · 4 KB
数据预览前 6 行
Sepal.LengthSepal.WidthPetal.LengthPetal.WidthSpecies
5.13.51.40.2setosa
4.931.40.2setosa
4.73.21.30.2setosa
4.63.11.50.2setosa
53.61.40.2setosa
5.43.91.70.4setosa
变量5 列
字符型1双精度4
类型
#变量类型缺失统计
1Sepal.LengthUnit is cm.双精度—min 4.3q1 —中位 5.8均值 5.84q3 —max 7.9
2Sepal.WidthUnit is cm.双精度—min 2q1 —中位 3均值 3.06q3 —max 4.4
3Petal.LengthUnit is cm.双精度—min 1q1 —中位 4.35均值 3.76q3 —max 6.9
4Petal.WidthUnit is cm.双精度—min 0.1q1 —中位 1.3均值 1.2q3 —max 2.5
5SpecieskeyIris species.字符型—不同值 3setosa · versicolor · virginica
载入已写好列类型
library(readr)

iris <- read_csv(
  "https://assets.evanzhou.org/tessera/csv/iris.csv",
  col_types = cols(
    Sepal.Length = col_double(),
    Sepal.Width  = col_double(),
    Petal.Length = col_double(),
    Petal.Width  = col_double(),
    Species      = col_character()
  )
)
URLhttps://assets.evanzhou.org/tessera/csv/iris.csv

Source

R 自带的 datasets::iris。150 朵鸢尾花分属 setosa、versicolor 和 virginica,每个物种各 50 条。

这里的 CSV 由 R 4.5.1 自带数据原样导出,不加行号、不改列名。完整出处与历史见 R 官方文档。

Use cases

  • 分组散点:比较三个物种在两项测量上的分离程度
  • 散点矩阵:同时查看四个连续变量的两两关系
  • 箱线 / 小提琴:按物种比较单项测量分布
  • 聚类图:检查无监督分组与真实物种是否相合
生成脚本R · 18 行
# 产物写到 ../csv/iris.csv —— 脚本和 CSV 是 content/tessera/data/ 下固定的兄弟目录,
# 所以按脚本自身定位,不依赖你在哪个目录敲这条命令。csv/ 不进仓库(见 .gitignore)。
#
# Rscript 时路径在 --file= 里,source() 时在 sys.frame()$ofile 里,两种都要认:
# 只取其中一种的话,另一种跑法会静默地把 CSV 写到当前目录去。
script_dir <- local({
  arg <- grep("^--file=", commandArgs(trailingOnly = FALSE), value = TRUE)
  path <- if (length(arg)) sub("^--file=", "", arg[[1L]]) else sys.frame(1)$ofile
  dirname(normalizePath(path, mustWork = TRUE))
})
out_csv <- file.path(script_dir, "..", "csv", "iris.csv")
dir.create(dirname(out_csv), recursive = TRUE, showWarnings = FALSE)

write.csv(
  datasets::iris,
  out_csv,
  row.names = FALSE
)

表中统计由 scripts/profile_dataset.py 于 2026-08-11 数出。