功能富集分析的概念与工具
在组学研究(如转录组学、蛋白质组学和代谢组学)中,研究者通常会获得一个包含成百上千个差异表达基因(Differentially Expressed Genes, DEGs)或蛋白质的列表。然而,单纯的基因列表无法直接揭示生物学意义。功能富集分析(Functional Enrichment Analysis)正是为了解决这一问题而设计的生物信息学方法。
其核心目标是将“基因列表”转化为“生物学功能”或“代谢通路”,通过统计学方法识别出在实验组中显著富集的生物学主题,从而帮助研究者理解样本之间差异的分子机制。
核心原理与统计学基础
功能富集分析的本质是检验一个预定义的基因集(如某个特定的生物学通路)在观察到的差异基因列表中出现的频率,是否显著高于其在背景基因集(所有检测到的基因)中出现的随机频率。
1. 超几何分布与 Fisher 精确检验
大多数富集分析工具采用超几何分布(Hypergeometric Distribution)或 Fisher 精确检验。其逻辑可以类比为“抽球模型”:
- 总体 (N):背景基因集(所有被检测到的基因)。
- 成功球 (M):属于某个特定功能通路(如“细胞凋亡”)的所有基因。
- 抽取样本 (n):研究者筛选出的差异基因列表。
- 样本中的成功球 (k):差异基因列表中同时属于该通路的基因数量。
如果 $k$ 的数值显著高于随机抽样的预期值,则认为该通路在样本中被“富集”了。
2. P 值与多重假设检验校正
由于一次分析会同时检验成百上千个通路,会产生严重的“多重比较”问题,导致假阳性增加。因此,必须对 P 值进行校正,常用的方法包括:
- Bonferroni 校正:最为严格,容易产生假阴性。
- Benjamini-Hochberg (BH) 法:控制错误发现率(False Discovery Rate, FDR),是目前组学分析的主流选择。
主流分析方法对比:ORA 与 GSEA
根据输入数据的不同,功能富集分析主要分为两种范式:过表达分析(ORA)和基因集富集分析(GSEA)。
| 维度 | 过表达分析 (ORA) | 基因集富集分析 (GSEA) |
|---|---|---|
| 输入数据 | 经过阈值筛选的差异基因列表 (DEGs) | 全量基因及其表达变化值 (Ranked List) |
| 筛选标准 | 依赖 P 值和 Fold Change 阈值 | 无需预设阈值,利用全量数据 |
| 核心逻辑 | 统计特定集合中基因的出现频率 | 统计基因集在排序列表中的分布位置 |
| 灵敏度 | 较低,容易忽略表达变化小但协同作用的基因 | 较高,能捕捉微弱但一致的表达趋势 |
| 适用场景 | 快速筛选显著变化的生物学过程 | 深入探索精细的调控机制 |
核心知识库(Database)
富集分析的效果高度依赖于所使用的注释数据库。目前最权威的知识库包括:
- Gene Ontology (GO):将基因功能分为三个独立但相关的维度:
- 生物过程 (Biological Process, BP):如“细胞周期”、“葡萄糖代谢”。
- 细胞组分 (Cellular Component, CC):如“线粒体”、“核糖体”。
- 分子功能 (Molecular Function, MF):如“激酶活性”、“DNA 结合”。
- KEGG (Kyoto Encyclopedia of Genes and Genomes):侧重于分子相互作用网络和代谢通路,将基因映射到具体的生化反应路径图中。
- Reactome / WikiPathways:提供更详细的人类生物学通路描述,具有更高的精细度。
常用工具链
根据技术背景的不同,研究者可以选择基于图形界面的 Web 工具或基于编程的分析包。
1. Web 端工具(适合快速分析)
- DAVID (Database for Annotation, Visualization and Integrated Discovery):经典工具,支持多种物种,功能全面。
- Metascape:现代化的集成平台,能够自动整合多个数据库并生成高质量的网络图。
- g:Profiler:速度极快,支持物种广泛,适合初步筛选。
2. 编程工具(适合大规模、标准化分析)
- clusterProfiler (R package):目前生物信息学领域最流行的 R 包。它不仅支持 ORA 和 GSEA,还能将结果与可视化图表(如点图、条形图、网络图)无缝衔接。
- fgsea (R package):专门用于快速执行 GSEA 算法的工具,计算效率极高。
分析全景工作流
一个标准的功能富集分析流程通常包含以下步骤:
- 数据预处理:通过差异分析(如 $\text{limma}$ 或 $\text{DESeq2}$)获得差异表达基因列表。
- ID 转换:将基因的 Symbol 或 Ensembl ID 转换为数据库可识别的 ID(如 Entrez ID)。
- 选择分析方法:根据研究目的选择 ORA(快速概览)或 GSEA(深度挖掘)。
- 执行富集计算:选择合适的数据库(GO/KEGG)进行统计检验。
- 结果过滤:根据 $\text{Adjusted P-value} < 0.05$ 和 $\text{Rich Factor}$ 筛选显著通路。
- 可视化与解释:绘制气泡图或通路图,结合生物学背景解释结果。