功能富集分析的概念与工具

在组学研究(如转录组学、蛋白质组学和代谢组学)中,研究者通常会获得一个包含成百上千个差异表达基因(Differentially Expressed Genes, DEGs)或蛋白质的列表。然而,单纯的基因列表无法直接揭示生物学意义。功能富集分析(Functional Enrichment Analysis)正是为了解决这一问题而设计的生物信息学方法。

其核心目标是将“基因列表”转化为“生物学功能”或“代谢通路”,通过统计学方法识别出在实验组中显著富集的生物学主题,从而帮助研究者理解样本之间差异的分子机制。

核心原理与统计学基础

功能富集分析的本质是检验一个预定义的基因集(如某个特定的生物学通路)在观察到的差异基因列表中出现的频率,是否显著高于其在背景基因集(所有检测到的基因)中出现的随机频率。

1. 超几何分布与 Fisher 精确检验

大多数富集分析工具采用超几何分布(Hypergeometric Distribution)或 Fisher 精确检验。其逻辑可以类比为“抽球模型”:

  • 总体 (N):背景基因集(所有被检测到的基因)。
  • 成功球 (M):属于某个特定功能通路(如“细胞凋亡”)的所有基因。
  • 抽取样本 (n):研究者筛选出的差异基因列表。
  • 样本中的成功球 (k):差异基因列表中同时属于该通路的基因数量。

如果 $k$ 的数值显著高于随机抽样的预期值,则认为该通路在样本中被“富集”了。

2. P 值与多重假设检验校正

由于一次分析会同时检验成百上千个通路,会产生严重的“多重比较”问题,导致假阳性增加。因此,必须对 P 值进行校正,常用的方法包括:

  • Bonferroni 校正:最为严格,容易产生假阴性。
  • Benjamini-Hochberg (BH) 法:控制错误发现率(False Discovery Rate, FDR),是目前组学分析的主流选择。

主流分析方法对比:ORA 与 GSEA

根据输入数据的不同,功能富集分析主要分为两种范式:过表达分析(ORA)和基因集富集分析(GSEA)。

维度 过表达分析 (ORA) 基因集富集分析 (GSEA)
输入数据 经过阈值筛选的差异基因列表 (DEGs) 全量基因及其表达变化值 (Ranked List)
筛选标准 依赖 P 值和 Fold Change 阈值 无需预设阈值,利用全量数据
核心逻辑 统计特定集合中基因的出现频率 统计基因集在排序列表中的分布位置
灵敏度 较低,容易忽略表达变化小但协同作用的基因 较高,能捕捉微弱但一致的表达趋势
适用场景 快速筛选显著变化的生物学过程 深入探索精细的调控机制

核心知识库(Database)

富集分析的效果高度依赖于所使用的注释数据库。目前最权威的知识库包括:

  • Gene Ontology (GO):将基因功能分为三个独立但相关的维度:
    • 生物过程 (Biological Process, BP):如“细胞周期”、“葡萄糖代谢”。
    • 细胞组分 (Cellular Component, CC):如“线粒体”、“核糖体”。
    • 分子功能 (Molecular Function, MF):如“激酶活性”、“DNA 结合”。
  • KEGG (Kyoto Encyclopedia of Genes and Genomes):侧重于分子相互作用网络和代谢通路,将基因映射到具体的生化反应路径图中。
  • Reactome / WikiPathways:提供更详细的人类生物学通路描述,具有更高的精细度。

常用工具链

根据技术背景的不同,研究者可以选择基于图形界面的 Web 工具或基于编程的分析包。

1. Web 端工具(适合快速分析)

  • DAVID (Database for Annotation, Visualization and Integrated Discovery):经典工具,支持多种物种,功能全面。
  • Metascape:现代化的集成平台,能够自动整合多个数据库并生成高质量的网络图。
  • g:Profiler:速度极快,支持物种广泛,适合初步筛选。

2. 编程工具(适合大规模、标准化分析)

  • clusterProfiler (R package):目前生物信息学领域最流行的 R 包。它不仅支持 ORA 和 GSEA,还能将结果与可视化图表(如点图、条形图、网络图)无缝衔接。
  • fgsea (R package):专门用于快速执行 GSEA 算法的工具,计算效率极高。

分析全景工作流

一个标准的功能富集分析流程通常包含以下步骤:

  1. 数据预处理:通过差异分析(如 $\text{limma}$ 或 $\text{DESeq2}$)获得差异表达基因列表。
  2. ID 转换:将基因的 Symbol 或 Ensembl ID 转换为数据库可识别的 ID(如 Entrez ID)。
  3. 选择分析方法:根据研究目的选择 ORA(快速概览)或 GSEA(深度挖掘)。
  4. 执行富集计算:选择合适的数据库(GO/KEGG)进行统计检验。
  5. 结果过滤:根据 $\text{Adjusted P-value} < 0.05$ 和 $\text{Rich Factor}$ 筛选显著通路。
  6. 可视化与解释:绘制气泡图或通路图,结合生物学背景解释结果。