蛋白质组学数据分析流程
蛋白质组学数据分析的目标,是从液相色谱-串联质谱(LC-MS/MS)产生的海量谱图中,可靠地鉴定蛋白质、量化其丰度,并识别具有生物学意义的差异。与基因组学不同,蛋白质组数据具有动态范围大、缺失值多、修饰复杂和批次效应显著等特点,因此流程需要兼顾统计严谨性与生物学可解释性。
一个典型的蛋白质组学数据分析流程可概括为以下环节:
- 实验设计与样本制备:明确比较组、生物学重复、随机化与对照设置。
- 质谱数据采集:选择 DDA、DIA 或靶向 PRM 等采集模式。
- 原始数据预处理:峰提取、去噪、保留时间对齐与质控。
- 肽段与蛋白鉴定:数据库搜索、FDR 控制与蛋白推断。
- 定量与归一化:标记或非标记定量,校正上样量与批次效应。
- 统计分析与差异筛选:缺失值处理、差异检验与多重检验校正。
- 功能注释与验证:GO、KEGG、GSEA 分析及 WB、PRM 等验证。
- 可视化与报告:火山图、热图、PCA,并记录参数与代码以保证可重复性。
实验设计与数据采集
实验设计决定后续分析上限。应设置足够的生物学重复,通常每组至少 3 个,复杂样本建议更多。样本制备需统一裂解、还原烷基化、酶切条件,避免引入系统性偏差。若采用标记定量,如 TMT、iTRAQ,应关注标记效率与通道间混合比例;若非标记定量,则需严格控制上样量和色谱稳定性。
数据采集模式方面,DDA 适合发现型研究,谱图质量高但低丰度蛋白重复性有限;DIA 可对全部前体离子进行碎片化,重复性和定量精度较好,适合大队列;PRM 则用于靶向验证,灵敏度和特异性高。
原始数据处理与肽段鉴定
原始数据通常为 .raw 或 .mzML 格式。常用工具包括 MaxQuant、MSFragger、Proteome Discoverer、DIA-NN 和 Spectronaut。处理步骤包括:
- 峰提取与同位素峰识别;
- 保留时间对齐与质量校准;
- 数据库搜索:设置酶切规则、固定修饰、可变修饰和母离子/碎片离子容差;
- 错误发现率控制:肽段和蛋白水平通常控制在 1% FDR;
- 蛋白推断:将共享肽合理分配给蛋白组,避免冗余。
对于未测序物种或新肽段,可结合 de novo 测序辅助鉴定,但需谨慎解释。
定量策略与归一化
定量可在肽段、蛋白或谱图水平进行。常见策略包括:
- 非标记定量:XIC 峰面积、谱图计数;
- 标记定量:SILAC、TMT、iTRAQ;
- 靶向定量:PRM/MRM。
归一化用于消除上样量、标记效率和仪器漂移。常用方法有中位数归一化、分位数归一化、VSN 和基于内标蛋白的校正。归一化后应检查 PCA 和样本相关性,确认批次效应是否被合理控制。
统计分析与差异蛋白筛选
分析前通常进行 log2 转换。缺失值需区分随机缺失与低丰度缺失,避免简单用 0 填充。差异分析可采用 limma moderated t-test、ANOVA 或混合效应模型,并计算效应量。多重检验校正常用 Benjamini-Hochberg 法,以 FDR < 0.05 且 |log2FC| > 1 作为常见阈值,但应结合生物学背景调整。
功能注释、验证与可视化
获得差异蛋白后,可进行 GO 富集、KEGG/Reactome 通路分析、GSEA 和激酶富集分析。注意背景基因集应使用实际鉴定到的蛋白,而非全基因组。验证手段包括 Western blot、免疫荧光、PRM 和免疫组化。可视化常用火山图、热图、聚类图、PCA 和通路网络图。
技术路线横向对比
| 维度 | DDA | DIA | PRM |
|---|---|---|---|
| 适用场景 | 发现型 | 大队列、重复定量 | 靶向验证 |
| 定量精度 | 中等 | 较高 | 高 |
| 缺失值 | 较多 | 相对较少 | 少 |
| 数据解析 | 依赖搜库 | 依赖谱图库或预测库 | 依赖目标列表 |
应用全景与注意事项
在细胞生物学研究中,蛋白质组学可用于比较不同处理、不同状态或不同亚细胞组分的全局蛋白变化。若进一步聚焦细胞器、细胞周期、信号转导或衰老癌变,应结合相应专门策略,如亚细胞分离、磷酸化富集或互作组学。无论何种应用,都需保留原始数据、分析参数和代码版本,并建议将数据上传至 PRIDE 等公共库,以提升可重复性。
示例:从蛋白定量表到差异分析
以下 R 代码展示了一个简化流程:
library(limma)
# 读取蛋白定量表,行名为蛋白,列为样本
expr <- log2(protein_intensity + 1)
expr <- normalizeBetweenArrays(expr, method = "quantile")
group <- factor(c("ctrl", "ctrl", "ctrl", "treat", "treat", "treat"))
design <- model.matrix(~ group)
fit <- lmFit(expr, design)
fit <- eBayes(fit)
res <- topTable(fit, coef = 2, number = Inf, adjust.method = "BH")
sig <- subset(res, adj.P.Val < 0.05 & abs(logFC) > 1)
该示例完成了归一化、差异检验和多重检验校正。后续可将 sig 中的蛋白用于富集分析和可视化。实际项目中,还需根据标记方式、缺失值比例和批次结构选择更合适的模型。