通路分析与生物学意义关联
通路分析通常位于组学流程的下游:上游实验产生基因、蛋白或代谢物列表,下游分析则尝试回答“这些分子变化共同指向哪些生物过程”。它的价值不在于再列出一批分子,而在于把统计显著的变化映射到先验知识体系,形成可检验的机制假说。需要强调的是,通路富集结果本身不是结论,而是连接数据与生物学意义的桥梁。
通路分析的核心思想是:如果一组功能相关的分子在实验中同时发生变化,那么它们所参与的通路可能被扰动。实现时通常包含三个要素:
- 分子标识映射:将基因、蛋白或代谢物 ID 转换为通路数据库可识别的标识。
- 背景集合定义:明确“从哪些分子中筛选”,例如所有检测到的基因,而不是全基因组。
- 统计检验与校正:判断某通路中的命中数是否显著高于随机期望,并控制多重检验错误。
常用知识库包括 GO、KEGG、Reactome、WikiPathways 和 MSigDB。它们覆盖范围不同:GO 偏功能注释,KEGG 偏代谢与信号通路,Reactome 层级细致,MSigDB 适合基因集富集分析。
主要方法横向对比
过代表分析
过代表分析先设定阈值,例如差异表达基因 FDR < 0.05 且 |log2FC| > 1,再用超几何检验判断这些基因是否在通路中富集。优点是直观、易解释;缺点是依赖阈值,忽略未达阈值但协调变化的基因,也容易丢失方向信息。
功能类评分与基因集富集分析
这类方法使用全部基因的排序,例如按 log2FC 或 log2FC × -log10(p) 排序,然后检验某基因集是否集中在排序两端。输出包括 ES、NES 和 FDR。它不依赖硬阈值,能捕捉弱但一致的变化,适合解释复杂表型。缺点是结果对排序指标和基因集版本较敏感。
拓扑与网络分析
拓扑分析在富集基础上考虑通路内节点的度、位置和串扰;网络分析则利用蛋白互作、共表达或调控网络识别模块与枢纽分子。它们更接近机制,但对网络质量和覆盖度依赖较强,解释时需谨慎。
从统计显著到生物学意义
统计显著只是起点。要关联生物学意义,至少需要关注以下维度:
- 方向性:通路是被激活还是抑制。若通路包含抑制因子,基因上调可能意味着通路受抑。
- 上下文:细胞类型、组织、疾病阶段、时间点和剂量都会改变通路解释。
- 冗余性:KEGG 与 Reactome 通路常高度重叠,应通过相似性削减或聚类归纳主题。
- 因果性:富集结果是相关性证据,需通过扰动实验、抑制剂或遗传操作验证。
- 效应量:不要只看 p 值,命中基因数、富集倍数和 NES 同样重要。
一个典型工作流示例
假设某 RNA-seq 实验比较处理组与对照组,获得差异表达结果。可按以下步骤进行:
- 整理输入表:基因 ID、log2FC、p 值、FDR。
- 定义背景:所有在样本中检测到的基因。
- 运行过代表分析:选取 FDR < 0.05 且 |log2FC| > 1 的基因,在 Reactome 中富集,保留 FDR < 0.05 的通路。
- 运行 GSEA:按 log2FC × -log10(p) 排序,在 MSigDB Hallmark 中富集,关注 NES > 1.5 或 < -1.5 且 FDR < 0.05 的基因集。
- 解释结果:若干扰素 α 响应通路上调,同时 G2/M 检查点下调,可提出“处理诱导抗病毒状态并抑制增殖”的假说。
- 可视化与验证:用气泡图、富集曲线和通路图展示,再通过 qPCR、Western blot 或扰动实验验证关键节点。
常见陷阱与最佳实践
- 背景基因集与实验检测范围不匹配,会严重扭曲富集结果。
- 忽略多重检验校正,容易得到大量假阳性通路。
- 基因 ID 转换丢失过多,导致通路覆盖偏差。
- 只报告显著通路,不说明方向、效应量和冗余。
- 把富集通路直接当作因果机制,跳过验证。
- 数据库版本、物种和注释质量应记录在方法中。
应用全景与子主题关系
通路分析广泛应用于疾病机制研究、药物靶点发现、生物标志物解释、毒理评估、微生物互作和植物胁迫响应。在分子技术与组学方法论中,它属于解释层:测序与组学分析提供表达、变异或修饰数据,基因工程与 CRISPR 技术可提供扰动后的基因列表,而通路分析负责把这些列表放入生物过程框架。具体测序平台、CRISPR 筛选设计等细节属于子主题,本文不再展开。
总之,通路分析的目标不是生成更长的表格,而是把分子变化压缩为可解释、可验证的生物学主题。只有结合方向性、上下文、效应量和实验验证,才能真正完成从统计显著到生物学意义的关联。