系统发育树的构建基础
系统发育树是用树状图表示生物或基因之间演化关系的工具。它由节点、分支和叶端组成:叶端通常代表现生类群或操作分类单元,内部节点代表推断的共同祖先,分支代表演化谱系。树的拓扑结构描述类群之间的分支顺序,支长则常表示遗传距离、时间或演化速率。
系统发育树可分为有根树和无根树。有根树具有明确的演化方向,能指出共同祖先和演化时间;无根树只展示类群之间的相对关系,不指定祖先—后代方向。若要用外群定根,通常选择一个与内群亲缘关系较远但同源的类群,将其连接到内群基部。
构建系统发育树的核心假设是:用于分析的性状或序列具有同源性,即来源于共同祖先。若相似性来自趋同、平行演化或逆转,则属于同塑性,会干扰系统发育推断。
构建前的数据准备
系统发育分析的第一步是选择合适的数据。常用数据包括:
- 分子数据:DNA、RNA、蛋白质序列;
- 形态数据:骨骼、花部结构、行为等离散或连续性状;
- 基因组数据:单拷贝直系同源基因、保守非编码区等。
对于分子数据,通常需要进行多序列比对,使同源位点对齐。比对后应检查并修剪高变区、模糊区和缺失数据过多的区域。随后可选择替代模型,例如 JC69、K2P、HKY85 或 GTR,以描述碱基替换规律。
数据准备中还需注意:
- 尽量使用直系同源基因,避免旁系同源基因;
- 检查是否存在重组、水平基因转移或饱和突变;
- 选择合适的外群,用于定根和判断性状极性;
- 若使用形态数据,应明确编码标准并评估同塑性。
主要构建方法及横向对比
系统发育树的构建方法很多,常见的有距离法、最大简约法、最大似然法和贝叶斯推断。
| 方法 | 基本原理 | 优点 | 局限 |
|---|---|---|---|
| 距离法 | 先计算成对遗传距离,再聚类建树 | 快速,适合大规模初步分析 | 丢失位点信息,对模型敏感 |
| 最大简约法 | 选择所需演化变化最少的树 | 直观,适合近缘类群 | 可能受长枝吸引影响 |
| 最大似然法 | 在给定模型下选择似然最大的树 | 统计基础强,可整合复杂模型 | 计算量大 |
| 贝叶斯推断 | 通过 MCMC 估计树的后验分布 | 支持度易解释,可整合先验 | 计算密集,对先验敏感 |
距离法中的邻接法不假设严格分子钟,常用于快速探索。最大简约法适合序列差异较小、演化速率较均匀的数据。最大似然法和贝叶斯推断则更适合处理复杂替换过程,但需要更多计算资源。
支持度与树的可信性
一棵系统发育树并非绝对真理,而是基于数据和模型的统计推断。常用支持度指标包括:
- 自举支持率:通过对位点重采样评估分支稳定性,通常认为大于 70% 较可靠;
- 贝叶斯后验概率:表示在模型和数据下该分支成立的概率;
- 一致树:合并多棵最优树或后验树,展示稳定分支。
需要注意的是,自举支持率高并不等于分支一定正确,它只反映数据内部信号的一致性。若模型错误、采样偏差或存在长枝吸引,高支持度也可能支持错误拓扑。
一个简化示例
假设有四个物种 A、B、C、D,基于比对后的序列得到距离矩阵:
| A | B | C | D | |
|---|---|---|---|---|
| A | 0 | 2 | 6 | 6 |
| B | 2 | 0 | 6 | 6 |
| C | 6 | 6 | 0 | 2 |
| D | 6 | 6 | 2 | 0 |
邻接法首先连接距离最小的 A—B 和 C—D,再将两个内部节点相连,得到无根树:
A B C D
\ / \ /
* *
\ /
\ /
*
若引入外群 E,并推断 E 与内群连接的位置,即可将无根树定根。该树表明 A 与 B 亲缘较近,C 与 D 亲缘较近,而这两组之间关系较远。
应用全景与常见误区
系统发育树是宏进化与生物多样性研究的通用框架。它可用于:
- 重建生命之树和类群分类;
- 推断性状演化顺序与演化速率;
- 评估生物地理格局和多样化动态;
- 识别保护单元和隐存种;
- 追踪病原体传播与基因家族扩张。
在大灭绝与适应辐射、协同进化与共同演化等主题中,系统发育树提供比较框架,但具体机制需结合专门分析。常见误区包括:将基因树直接等同于物种树、忽略水平基因转移和不完全谱系分选、忽视长枝吸引、以及过度依赖单一基因或单一方法。稳健的系统发育研究应整合多来源数据、多种方法,并明确报告支持度和不确定性。