系统发育树的构建基础

系统发育树是用树状图表示生物或基因之间演化关系的工具。它由节点、分支和叶端组成:叶端通常代表现生类群或操作分类单元,内部节点代表推断的共同祖先,分支代表演化谱系。树的拓扑结构描述类群之间的分支顺序,支长则常表示遗传距离、时间或演化速率。

系统发育树可分为有根树和无根树。有根树具有明确的演化方向,能指出共同祖先和演化时间;无根树只展示类群之间的相对关系,不指定祖先—后代方向。若要用外群定根,通常选择一个与内群亲缘关系较远但同源的类群,将其连接到内群基部。

构建系统发育树的核心假设是:用于分析的性状或序列具有同源性,即来源于共同祖先。若相似性来自趋同、平行演化或逆转,则属于同塑性,会干扰系统发育推断。

构建前的数据准备

系统发育分析的第一步是选择合适的数据。常用数据包括:

  • 分子数据:DNA、RNA、蛋白质序列;
  • 形态数据:骨骼、花部结构、行为等离散或连续性状;
  • 基因组数据:单拷贝直系同源基因、保守非编码区等。

对于分子数据,通常需要进行多序列比对,使同源位点对齐。比对后应检查并修剪高变区、模糊区和缺失数据过多的区域。随后可选择替代模型,例如 JC69、K2P、HKY85 或 GTR,以描述碱基替换规律。

数据准备中还需注意:

  1. 尽量使用直系同源基因,避免旁系同源基因;
  2. 检查是否存在重组、水平基因转移或饱和突变;
  3. 选择合适的外群,用于定根和判断性状极性;
  4. 若使用形态数据,应明确编码标准并评估同塑性。

主要构建方法及横向对比

系统发育树的构建方法很多,常见的有距离法、最大简约法、最大似然法和贝叶斯推断。

方法 基本原理 优点 局限
距离法 先计算成对遗传距离,再聚类建树 快速,适合大规模初步分析 丢失位点信息,对模型敏感
最大简约法 选择所需演化变化最少的树 直观,适合近缘类群 可能受长枝吸引影响
最大似然法 在给定模型下选择似然最大的树 统计基础强,可整合复杂模型 计算量大
贝叶斯推断 通过 MCMC 估计树的后验分布 支持度易解释,可整合先验 计算密集,对先验敏感

距离法中的邻接法不假设严格分子钟,常用于快速探索。最大简约法适合序列差异较小、演化速率较均匀的数据。最大似然法和贝叶斯推断则更适合处理复杂替换过程,但需要更多计算资源。

支持度与树的可信性

一棵系统发育树并非绝对真理,而是基于数据和模型的统计推断。常用支持度指标包括:

  • 自举支持率:通过对位点重采样评估分支稳定性,通常认为大于 70% 较可靠;
  • 贝叶斯后验概率:表示在模型和数据下该分支成立的概率;
  • 一致树:合并多棵最优树或后验树,展示稳定分支。

需要注意的是,自举支持率高并不等于分支一定正确,它只反映数据内部信号的一致性。若模型错误、采样偏差或存在长枝吸引,高支持度也可能支持错误拓扑。

一个简化示例

假设有四个物种 A、B、C、D,基于比对后的序列得到距离矩阵:

A B C D
A 0 2 6 6
B 2 0 6 6
C 6 6 0 2
D 6 6 2 0

邻接法首先连接距离最小的 A—B 和 C—D,再将两个内部节点相连,得到无根树:

A   B   C   D
 \ /     \ /
  *       *
   \     /
    \   /
     * 

若引入外群 E,并推断 E 与内群连接的位置,即可将无根树定根。该树表明 A 与 B 亲缘较近,C 与 D 亲缘较近,而这两组之间关系较远。

应用全景与常见误区

系统发育树是宏进化与生物多样性研究的通用框架。它可用于:

  • 重建生命之树和类群分类;
  • 推断性状演化顺序与演化速率;
  • 评估生物地理格局和多样化动态;
  • 识别保护单元和隐存种;
  • 追踪病原体传播与基因家族扩张。

在大灭绝与适应辐射、协同进化与共同演化等主题中,系统发育树提供比较框架,但具体机制需结合专门分析。常见误区包括:将基因树直接等同于物种树、忽略水平基因转移和不完全谱系分选、忽视长枝吸引、以及过度依赖单一基因或单一方法。稳健的系统发育研究应整合多来源数据、多种方法,并明确报告支持度和不确定性。