高通量测序数据的质控与预处理

高通量测序(NGS)一次运行即可产生数以亿计的读段(reads),但原始数据中不可避免地混有接头序列、低质量碱基、技术重复等“噪声”。若不加处理直接进入比对或定量环节,会导致比对率下降、变异误检、表达量偏差等问题。因此,质控与预处理是所有测序数据分析流程的起点,其质量直接决定下游结果的可靠性。
下机数据通常为 FASTQ 格式,每条 read 包含碱基序列与对应的质量值。拿到数据后,应先使用 FastQC、MultiQC 等工具生成质控报告,重点关注以下指标:

  • 碱基质量分布:Phred 质量值 Q 反映碱基判读错误概率(Q30 即错误率 0.1%)。多数平台碱基质量随读长增加而下降,属正常现象,但尾部质量骤降时需考虑截断。
  • 接头与污染:若插入片段短于读长,read 末端会带有接头序列;可借助 FastQ Screen 等工具筛查是否有其他物种 DNA 污染。
  • GC 含量分布:应与理论分布吻合,异常偏移可能提示污染、PCR 偏好或建库偏差。
  • 重复水平与过表达序列:重复读段过多可能反映起始 DNA 量不足或富集过度。
  • N 含量与读长分布:用于判断测序反应是否正常完成。

预处理的核心步骤

评估之后需对数据进行清洗,主要操作包括:

  1. 去除接头:识别并切除 read 中的接头序列及接头二聚体;
  2. 低质量碱基修剪:从末端滑窗式切除质量过低的碱基,例如滑动窗口平均质量低于 Q20 即截断;
  3. 过滤低质量读段:整条 read 中低质量碱基比例过高或含 N 过多时整条丢弃;
  4. 去除过短序列:修剪后长度低于最小阈值(如 50 bp)的读段不再保留;
  5. 去污染:视分析类型而定,如宏基因组分析通常需先去除宿主序列。

常用工具一览

工具 主要用途 特点
FastQC 原始数据质量评估 报告全面,行业标准
MultiQC 汇总多样本质控报告 适合批量样本项目管理
fastp 接头去除与质量修剪 速度快,一站式输出前后对比
Trimmomatic 修剪与过滤 参数灵活,经典工具
Cutadapt 接头去除 支持自定义接头序列
Picard 比对后去重与指标统计 SAM/BAM 处理标准组件

其中 fastp 因兼顾速度与功能,已成为目前最常用的“一站式”清洗工具。

比对后的二次质控

预处理并不止步于 FASTQ 清洗。将 reads 比对到参考基因组(如使用 BWA-MEM、Bowtie2)后,还应检查:

  • 比对率:全基因组数据通常应高于 95%,外显子组约 70%–90%,转录组数据视注释完整度而定;
  • 重复率:PCR 重复过高说明起始量不足,可用 Picard 标记并去重;
  • 覆盖度与深度:目标区域是否均匀覆盖,有无明显覆盖缺口;
  • 插入片段分布与链偏好性:出现异常往往提示建库环节存在问题。

不同应用场景的质控侧重

质控策略需与分析目的相匹配,横向对比如下:

  • 全基因组重测序:关注比对率、覆盖深度均一性与重复率,为后续变异检测打基础;
  • 外显子组与靶向测序:重点评估目标区域的捕获效率与覆盖均一性;
  • 转录组测序:需额外评估 rRNA 残留、5'/3' 端偏好及比对到转录组的比例,且一般不建议过度修剪,以免影响基因定量;
  • 宏基因组测序:强调宿主序列去除与物种污染筛查。

实践建议与小结

一个规范的流程示例为:FastQC 初评 → fastp 清洗 → FastQC/MultiQC 复评 → 比对 → samtools flagstat 与 Picard 二次质控,各阶段报告统一汇总、便于追溯。建议将质控参数(如最短长度、质量阈值)写入脚本并做版本化管理,保证分析的可重复性。质控虽不直接产生生物学结论,却是整条分析链可信度的基石——在预处理阶段投入足够的细致,往往能避免下游大量返工。