FinnGen 定期发布 GWAS summary statistics。它们记录 variants 与 phenotypes 的关联结果,可作为 Mendelian randomization、colocalization、fine-mapping 和其他 summary-level genetic analyses 的输入。
公开的 summary statistics 不是 individual-level genotype 或 health records。使用前需要同时确认 release、phenotype definition、case/control counts、genome build、字段含义和数据使用政策,不能只凭文件名选择 outcome。
FinnGen 主页:finngen.fi。
先理解 release 与 phenotype
FinnGen 的公开结果按 release 组织,例如 R11、R12。同一个 phenotype 在不同 release 中可能因样本量、病例定义、质量控制或分析流程变化而产生不同 summary statistics。
下载前先记录:
| 信息 | 为什么需要 |
|---|---|
| Release | 确定数据版本和分析批次 |
| Phenotype ID | 精确定位 endpoint,而不是只依赖显示名称 |
| Phenotype definition | 判断纳入、排除与诊断编码是否符合研究问题 |
| Number of cases / controls | 解释统计功效并准备二元性状分析 |
| Genome build | 与 LD reference、QTL 和其他 GWAS 对齐 |
| Ancestry / analysis population | 选择匹配的 LD reference 并解释外推范围 |
| Embargo / data-use terms | 判断结果如何使用和发表 |
原始笔记记录的 FinnGen 数据政策包括公开 release、发布保护期与定期更新。实际使用某个 release 时,应把对应页面和说明文件与下载数据一起保存。
查看图片FinnGen 数据访问与发布说明

从结果访问页面开始
访问 FinnGen 的 Access results 页面。这个页面是公开数据入口,集中提供 release 说明、浏览和下载方式。
基本流程:
- 打开 Access results;
- 选择需要的公开 release;
- 阅读该 release 的 data policy 与 readme;
- 根据页面提示完成访问登记;
- 从收到的访问地址进入结果浏览或批量下载位置。
原流程中的注册链接位于数据下载说明中:
查看图片FinnGen 数据访问注册入口

登记后,访问地址通过邮件提供:
查看图片FinnGen 数据下载邮件

访问邮件和下载 URL 可能包含该次 release 的具体路径。项目中应记录公开 release 页面,而不是把个人邮件当作唯一的数据来源说明。
Manifest 是下载入口
Release manifest 列出可用 phenotypes 及其 summary-statistics 文件位置。面对大量 endpoints 时,不应手动逐页点击;先在 manifest 中筛选 phenotype,再下载对应文件。
原笔记保存了 FinnGen R12 的两份辅助文件:
| 文件 | 用途 |
|---|---|
summary_stats_finngen_R12_manifest.tsv |
R12 phenotypes、元信息与文件路径 |
summary_stats_finngen_R12_summary_stats_readme.txt |
summary-statistics 字段和格式说明 |
当时使用的共享副本:
Manifest 负责定位数据,readme 负责解释数据。两者应与实际下载的 release 保持一致,不能用一个 release 的 readme 猜测另一个 release 的字段。
在 R 中筛选 manifest
library(data.table)
manifest <- fread(
"summary_stats_finngen_R12_manifest.tsv",
data.table = FALSE
)
names(manifest)
dim(manifest)
head(manifest)
先查看实际列名,再按 phenotype ID 或描述筛选,不要预设不同 release 使用完全相同的 manifest schema。
按文本查找候选 endpoint:
pattern <- "squamous cell carcinoma"
hits <- manifest[
grepl(
pattern,
apply(manifest, 1, paste, collapse = " "),
ignore.case = TRUE
),
]
hits
找到候选后,应回到 phenotype definition 核对,而不是把模糊文本搜索结果直接作为研究 outcome。
如果已经知道 endpoint ID,使用精确匹配:
endpoint_id <- "C3_SQUOMOUS_CELL_CARCINOMA_SKIN_EXALLC"
selected <- manifest[
manifest$phenocode == endpoint_id,
]
这里的 phenocode 只是示例字段名;应以当前 manifest 的实际列名为准。
下载后检查 summary statistics
library(data.table)
gwas <- fread(
"finngen_R10_C3_SQUOMOUS_CELL_CARCINOMA_SKIN_EXALLC.gz",
data.table = FALSE
)
dim(gwas)
names(gwas)
head(gwas)
常见信息包括 chromosome、position、reference/effect alleles、allele frequency、beta、standard error、p-value 与 rsID,但具体名称应以对应 readme 为准。
基础检查:
summary(gwas$pval)
summary(gwas$beta)
summary(gwas$sebeta)
summary(gwas$af_alt)
sum(is.na(gwas$rsids))
sum(gwas$rsids == "", na.rm = TRUE)
sum(grepl(",", gwas$rsids), na.rm = TRUE)
进一步确认:
beta对应哪个 effect allele;- allele frequency 是否也是同一个 allele 的频率;
- 二元性状 effect 是否位于 log-odds scale;
- chromosome 与 position 使用哪个 build;
- 是否存在多 rsID、缺失 rsID 或非双等位 variants;
- 每个 variant 的有效样本量是否一致;
- 文件是否已经压缩、排序或过滤。
字段名看起来熟悉也不能代替 readme。等位基因方向一旦理解错误,下游 harmonization、MR 和 SMR 都会继承错误。
保存数据来源记录
每个下载文件旁至少保存一份元数据记录:
Resource: FinnGen
Release: R12
Phenotype ID: ...
Phenotype definition: ...
Cases / controls: ...
Genome build: ...
Download date: ...
Manifest filename: ...
Summary-statistics filename: ...
Source page: https://www.finngen.fi/en/access_results
可以同时计算文件 checksum:
tools::md5sum("summary-statistics-file.gz")
Release 是数据自身的版本;download date 是本地获取时间;分析代码的 Git commit 是代码版本。三者回答不同问题,应分别记录。
与后续分析的边界
这一步只负责取得并理解 FinnGen 数据。下游分析前还需要根据具体方法完成:
- variant 与 allele harmonization;
- genome-build 与坐标对齐;
- ancestry-matched LD reference 选择;
- sample overlap 评估;
- phenotype definition 与研究问题匹配;
- 方法所需的格式转换。
例如 SMR 需要把 GWAS 整理为 .ma 格式,共定位需要区域 summary statistics 与必要的 LD 信息。这些属于 Genomic Analysis,而不是 FinnGen 数据下载本身。
FinnGen summary statistics 的价值来自规模和公开可访问性,但公开、方便和样本量大并不自动保证适合每个研究问题。真正的入口始终是 phenotype definition 和 release documentation。