03获取 FinnGen GWAS 汇总数据

从 FinnGen release 页面确认 phenotype 与数据版本,通过 manifest 定位并下载公开 GWAS summary statistics。

2025-11-03
FinnGenGWASSummary StatisticsManifestGenetics
本章目录 · 7

FinnGen 定期发布 GWAS summary statistics。它们记录 variants 与 phenotypes 的关联结果,可作为 Mendelian randomization、colocalization、fine-mapping 和其他 summary-level genetic analyses 的输入。

公开的 summary statistics 不是 individual-level genotype 或 health records。使用前需要同时确认 release、phenotype definition、case/control counts、genome build、字段含义和数据使用政策,不能只凭文件名选择 outcome。

FinnGen 主页:finngen.fi

先理解 release 与 phenotype

FinnGen 的公开结果按 release 组织,例如 R11R12。同一个 phenotype 在不同 release 中可能因样本量、病例定义、质量控制或分析流程变化而产生不同 summary statistics。

下载前先记录:

信息 为什么需要
Release 确定数据版本和分析批次
Phenotype ID 精确定位 endpoint,而不是只依赖显示名称
Phenotype definition 判断纳入、排除与诊断编码是否符合研究问题
Number of cases / controls 解释统计功效并准备二元性状分析
Genome build 与 LD reference、QTL 和其他 GWAS 对齐
Ancestry / analysis population 选择匹配的 LD reference 并解释外推范围
Embargo / data-use terms 判断结果如何使用和发表

原始笔记记录的 FinnGen 数据政策包括公开 release、发布保护期与定期更新。实际使用某个 release 时,应把对应页面和说明文件与下载数据一起保存。

查看图片FinnGen 数据访问与发布说明
FinnGen 数据访问与发布说明

从结果访问页面开始

访问 FinnGen 的 Access results 页面。这个页面是公开数据入口,集中提供 release 说明、浏览和下载方式。

基本流程:

  1. 打开 Access results;
  2. 选择需要的公开 release;
  3. 阅读该 release 的 data policy 与 readme;
  4. 根据页面提示完成访问登记;
  5. 从收到的访问地址进入结果浏览或批量下载位置。

原流程中的注册链接位于数据下载说明中:

查看图片FinnGen 数据访问注册入口
FinnGen 数据访问注册入口

登记后,访问地址通过邮件提供:

查看图片FinnGen 数据下载邮件
FinnGen 数据下载邮件

访问邮件和下载 URL 可能包含该次 release 的具体路径。项目中应记录公开 release 页面,而不是把个人邮件当作唯一的数据来源说明。

Manifest 是下载入口

Release manifest 列出可用 phenotypes 及其 summary-statistics 文件位置。面对大量 endpoints 时,不应手动逐页点击;先在 manifest 中筛选 phenotype,再下载对应文件。

原笔记保存了 FinnGen R12 的两份辅助文件:

文件 用途
summary_stats_finngen_R12_manifest.tsv R12 phenotypes、元信息与文件路径
summary_stats_finngen_R12_summary_stats_readme.txt summary-statistics 字段和格式说明

当时使用的共享副本:

Manifest 负责定位数据,readme 负责解释数据。两者应与实际下载的 release 保持一致,不能用一个 release 的 readme 猜测另一个 release 的字段。

在 R 中筛选 manifest

library(data.table)

manifest <- fread(
  "summary_stats_finngen_R12_manifest.tsv",
  data.table = FALSE
)

names(manifest)
dim(manifest)
head(manifest)

先查看实际列名,再按 phenotype ID 或描述筛选,不要预设不同 release 使用完全相同的 manifest schema。

按文本查找候选 endpoint:

pattern <- "squamous cell carcinoma"

hits <- manifest[
  grepl(
    pattern,
    apply(manifest, 1, paste, collapse = " "),
    ignore.case = TRUE
  ),
]

hits

找到候选后,应回到 phenotype definition 核对,而不是把模糊文本搜索结果直接作为研究 outcome。

如果已经知道 endpoint ID,使用精确匹配:

endpoint_id <- "C3_SQUOMOUS_CELL_CARCINOMA_SKIN_EXALLC"

selected <- manifest[
  manifest$phenocode == endpoint_id,
]

这里的 phenocode 只是示例字段名;应以当前 manifest 的实际列名为准。

下载后检查 summary statistics

library(data.table)

gwas <- fread(
  "finngen_R10_C3_SQUOMOUS_CELL_CARCINOMA_SKIN_EXALLC.gz",
  data.table = FALSE
)

dim(gwas)
names(gwas)
head(gwas)

常见信息包括 chromosome、position、reference/effect alleles、allele frequency、beta、standard error、p-value 与 rsID,但具体名称应以对应 readme 为准。

基础检查:

summary(gwas$pval)
summary(gwas$beta)
summary(gwas$sebeta)
summary(gwas$af_alt)

sum(is.na(gwas$rsids))
sum(gwas$rsids == "", na.rm = TRUE)
sum(grepl(",", gwas$rsids), na.rm = TRUE)

进一步确认:

  • beta 对应哪个 effect allele;
  • allele frequency 是否也是同一个 allele 的频率;
  • 二元性状 effect 是否位于 log-odds scale;
  • chromosome 与 position 使用哪个 build;
  • 是否存在多 rsID、缺失 rsID 或非双等位 variants;
  • 每个 variant 的有效样本量是否一致;
  • 文件是否已经压缩、排序或过滤。

字段名看起来熟悉也不能代替 readme。等位基因方向一旦理解错误,下游 harmonization、MR 和 SMR 都会继承错误。

保存数据来源记录

每个下载文件旁至少保存一份元数据记录:

Resource: FinnGen
Release: R12
Phenotype ID: ...
Phenotype definition: ...
Cases / controls: ...
Genome build: ...
Download date: ...
Manifest filename: ...
Summary-statistics filename: ...
Source page: https://www.finngen.fi/en/access_results

可以同时计算文件 checksum:

tools::md5sum("summary-statistics-file.gz")

Release 是数据自身的版本;download date 是本地获取时间;分析代码的 Git commit 是代码版本。三者回答不同问题,应分别记录。

与后续分析的边界

这一步只负责取得并理解 FinnGen 数据。下游分析前还需要根据具体方法完成:

  • variant 与 allele harmonization;
  • genome-build 与坐标对齐;
  • ancestry-matched LD reference 选择;
  • sample overlap 评估;
  • phenotype definition 与研究问题匹配;
  • 方法所需的格式转换。

例如 SMR 需要把 GWAS 整理为 .ma 格式,共定位需要区域 summary statistics 与必要的 LD 信息。这些属于 Genomic Analysis,而不是 FinnGen 数据下载本身。

FinnGen summary statistics 的价值来自规模和公开可访问性,但公开、方便和样本量大并不自动保证适合每个研究问题。真正的入口始终是 phenotype definition 和 release documentation。