RNA-seq数据标准化与归一化
在转录组测序(RNA-seq)实验中,原始数据通常以“Read Counts”(读取计数)的形式呈现,即每个基因在每个样本中被测到的片段数量。然而,原始计数不能直接用于样本间的比较或基因间的表达量分析。这是因为测序数据受到多种非生物因素的干扰,产生了系统性偏差(Systematic Bias)。
数据标准化(Normalization)的核心目标是消除这些技术噪声,使得不同样本之间、不同基因之间的表达量具有可比性,从而确保观察到的差异是由生物学因素而非实验误差引起的。
影响数据可比性的主要偏差源
在进行标准化之前,必须理解导致数据偏差的三个关键因素:
- 测序深度(Sequencing Depth/Library Size):
不同样本的总测序量(Total Reads)通常不一致。如果样本 A 的总测序量是样本 B 的两倍,那么即使两个样本中某个基因的实际表达量相同,样本 A 测得的 Read Counts 也会更高。 - 基因长度(Gene Length):
在相同的表达水平下,较长的基因会产生更多的片段,从而在测序中获得更高的计数。因此,在比较同一样本内不同基因的表达量时,必须校正基因长度。 - RNA 组成偏差(RNA Composition Bias):
如果少数几个基因在某个样本中极高表达(例如在某些组织中,管家基因或特定功能基因占据了总 RNA 的绝大部分),它们会“挤占”其他基因的测序份额,导致其他基因的 Read Counts 相对下降,即便它们的实际表达量并未改变。
样本内标准化:基因间表达量比较
当研究目标是分析“在同一个样本中,基因 A 的表达量是否高于基因 B”时,需要进行样本内标准化。
RPKM 与 FPKM
- RPKM (Reads Per Kilobase million): 针对单端测序,先校正测序深度,再校正基因长度。
- FPKM (Fragments Per Kilobase million): 针对双端测序,将一对 reads 计为一个 fragment,计算逻辑与 RPKM 类似。
- 局限性: FPKM/RPKM 的总和在不同样本间是不相等的,这导致其无法直接用于样本间的定量比较。
TPM (Transcripts Per Million)
TPM 是目前学术界更推荐的样本内标准化方法。其计算顺序与 FPKM 相反:先校正基因长度,再校正测序深度。
- 计算步骤:
- 将 Read Count 除以基因长度 $\rightarrow$ 得到 $\text{Reads Per Kilobase (RPK)}$。
- 计算所有基因 RPK 的总和。
- 将每个基因的 RPK 除以总和,再乘以 $10^6$。
- 优势: 每个样本的 TPM 总和恒定为 $10^6$,使得不同样本间的比例关系更具可比性。
样本间标准化:差异表达分析
当研究目标是“在样本 A 和样本 B 之间,基因 X 的表达量是否有显著差异”时,重点在于消除样本间的系统偏差,而非基因长度(因为同一基因在不同样本中的长度是恒定的)。
CPM (Counts Per Million)
最简单的标准化方法,仅校正测序深度:
$$\text{CPM} = \frac{\text{Gene Count}}{\text{Total Reads in Sample}} \times 10^6$$
CPM 无法处理上述的“RNA 组成偏差”,在处理高度异质性的样本时容易产生伪阳性。
TMM (Trimmed Mean of M-values)
TMM 是 edgeR 软件采用的方法。它假设大多数基因是不差异表达的,通过剔除表达量极高和极低的基因(Trimmed),计算一个缩放因子(Scaling Factor)来校正库大小。这种方法能有效抵消由少数高表达基因引起的组成偏差。
Median-of-Ratios (DESeq2)
DESeq2 采用的一种鲁棒性极强的标准化方法:
- 为每个基因创建所有样本的几何平均值作为“参考基因”。
- 计算每个样本中基因表达量与参考值的比率。
- 取所有比率的中位数作为该样本的标准化因子(Size Factor)。
这种方法在处理样本间波动较大的数据时表现尤为稳定。
标准化方法横向对比与选择指南
为了方便在实际实验设计中选择合适的方法,下表总结了不同指标的应用场景:
| 方法 | 校正深度 | 校正长度 | 校正组成 | 适用场景 | 推荐用途 |
|---|---|---|---|---|---|
| CPM | $\checkmark$ | $\times$ | $\times$ | 快速初步观察 | 简单可视化 |
| FPKM | $\checkmark$ | $\checkmark$ | $\times$ | 样本内基因比较 | 历史数据对比 |
| TPM | $\checkmark$ | $\checkmark$ | $\times$ | 样本内基因比较 | 基因表达丰度定量 |
| TMM | $\checkmark$ | $\times$ | $\checkmark$ | 样本间差异分析 | edgeR 差异表达分析 |
| DESeq2 | $\checkmark$ | $\times$ | $\checkmark$ | 样本间差异分析 | DESeq2 差异表达分析 |
应用全景与分析流程建议
在完整的遗传学数据分析管线中,标准化并非单一步骤,而应根据分析目的分阶段进行:
- 探索性分析阶段:
使用 TPM 或 CPM 进行 PCA(主成分分析)或热图绘制,以观察样本的聚类情况和离群值。 - 差异表达分析 (DEA) 阶段:
禁止直接使用 TPM 或 FPKM 作为DESeq2或edgeR的输入。这些统计模型要求输入原始的 Raw Counts,因为它们内部集成了基于负二项分布的标准化算法(如 Median-of-Ratios 或 TMM),能够更准确地估计离散度和显著性 $p$ 值。 - 跨平台/跨研究比较阶段:
如果需要对比不同实验室、不同测序平台的数据,建议采用分位数标准化(Quantile Normalization)或批次效应校正工具(如Combat),以消除系统性的批次差异。
通过正确选择标准化策略,研究者可以将技术噪声降至最低,从而在复杂的转录组数据中精准捕捉到具有生物学意义的遗传变异与表达模式。