高通量测序数据的质控与预处理
高通量测序(NGS)一次运行即可产生数以亿计的读段(reads),但原始数据中不可避免地混有接头序列、低质量碱基、技术重复等“噪声”。若不加处理直接进入比对或定量环节,会导致比对率下降、变异误检、表达量偏差等问题。因此,质控与预处理是所有测序数据分析流程的起点,其质量直接决定下游结果的可靠性。
下机数据通常为 FASTQ 格式,每条 read 包含碱基序列与对应的质量值。拿到数据后,应先使用 FastQC、MultiQC 等工具生成质控报告,重点关注以下指标:
- 碱基质量分布:Phred 质量值 Q 反映碱基判读错误概率(Q30 即错误率 0.1%)。多数平台碱基质量随读长增加而下降,属正常现象,但尾部质量骤降时需考虑截断。
- 接头与污染:若插入片段短于读长,read 末端会带有接头序列;可借助 FastQ Screen 等工具筛查是否有其他物种 DNA 污染。
- GC 含量分布:应与理论分布吻合,异常偏移可能提示污染、PCR 偏好或建库偏差。
- 重复水平与过表达序列:重复读段过多可能反映起始 DNA 量不足或富集过度。
- N 含量与读长分布:用于判断测序反应是否正常完成。
预处理的核心步骤
评估之后需对数据进行清洗,主要操作包括:
- 去除接头:识别并切除 read 中的接头序列及接头二聚体;
- 低质量碱基修剪:从末端滑窗式切除质量过低的碱基,例如滑动窗口平均质量低于 Q20 即截断;
- 过滤低质量读段:整条 read 中低质量碱基比例过高或含 N 过多时整条丢弃;
- 去除过短序列:修剪后长度低于最小阈值(如 50 bp)的读段不再保留;
- 去污染:视分析类型而定,如宏基因组分析通常需先去除宿主序列。
常用工具一览
| 工具 | 主要用途 | 特点 |
|---|---|---|
| FastQC | 原始数据质量评估 | 报告全面,行业标准 |
| MultiQC | 汇总多样本质控报告 | 适合批量样本项目管理 |
| fastp | 接头去除与质量修剪 | 速度快,一站式输出前后对比 |
| Trimmomatic | 修剪与过滤 | 参数灵活,经典工具 |
| Cutadapt | 接头去除 | 支持自定义接头序列 |
| Picard | 比对后去重与指标统计 | SAM/BAM 处理标准组件 |
其中 fastp 因兼顾速度与功能,已成为目前最常用的“一站式”清洗工具。
比对后的二次质控
预处理并不止步于 FASTQ 清洗。将 reads 比对到参考基因组(如使用 BWA-MEM、Bowtie2)后,还应检查:
- 比对率:全基因组数据通常应高于 95%,外显子组约 70%–90%,转录组数据视注释完整度而定;
- 重复率:PCR 重复过高说明起始量不足,可用 Picard 标记并去重;
- 覆盖度与深度:目标区域是否均匀覆盖,有无明显覆盖缺口;
- 插入片段分布与链偏好性:出现异常往往提示建库环节存在问题。
不同应用场景的质控侧重
质控策略需与分析目的相匹配,横向对比如下:
- 全基因组重测序:关注比对率、覆盖深度均一性与重复率,为后续变异检测打基础;
- 外显子组与靶向测序:重点评估目标区域的捕获效率与覆盖均一性;
- 转录组测序:需额外评估 rRNA 残留、5'/3' 端偏好及比对到转录组的比例,且一般不建议过度修剪,以免影响基因定量;
- 宏基因组测序:强调宿主序列去除与物种污染筛查。
实践建议与小结
一个规范的流程示例为:FastQC 初评 → fastp 清洗 → FastQC/MultiQC 复评 → 比对 → samtools flagstat 与 Picard 二次质控,各阶段报告统一汇总、便于追溯。建议将质控参数(如最短长度、质量阈值)写入脚本并做版本化管理,保证分析的可重复性。质控虽不直接产生生物学结论,却是整条分析链可信度的基石——在预处理阶段投入足够的细致,往往能避免下游大量返工。