重复测量与纵向数据的遗传分析
在数量遗传学与育种实践中,许多重要经济性状并非只测量一次。例如奶牛的产奶量按泌乳月记录,猪的体重按周龄测定,林木的胸径按年份调查,人类的身高或血压在纵向队列中反复观测。这类数据统称为重复测量数据或纵向数据。与单次记录相比,它们包含个体随时间变化的信息,能够分离遗传效应、永久环境效应和临时环境效应,从而提高遗传参数估计的精度和育种值预测的准确性。
本文处于“群体与数量遗传”父主题层面,聚焦重复测量与纵向数据遗传分析的通用原理、模型横向对比与应用全景。哈迪温伯格平衡、数量性状与遗传力等子主题将在专门文章中深入讲解,本文仅在必要处简要提及。
基本概念与数据特征
重复测量与纵向数据具有以下核心特征:
- 个体内相关:同一个体的多次观测通常比不同个体间的观测更相似。
- 时间有序:纵向数据的观测时间具有顺序性,时间间隔可能不等。
- 数据不平衡:不同个体的测量次数、测量时间点往往不同。
- 多水平结构:观测嵌套于个体,个体嵌套于群体或家系。
遗传分析的核心目标包括:
- 估计方差组分,如加性遗传方差、永久环境方差、临时环境方差。
- 计算重复力与遗传力,前者衡量单次记录作为个体永久表现的可靠性,后者衡量遗传效应占总变异的比例。
- 预测个体育种值,并评估其随时间的变化。
- 估计不同时间点之间的遗传相关,揭示性状的发育遗传规律。
通用分析框架:混合线性模型
重复测量与纵向数据的遗传分析通常建立在混合线性模型框架之上。其一般形式可写为:
[
\mathbf{y} = \mathbf{X}\mathbf{b} + \mathbf{Z}\mathbf{u} + \mathbf{W}\mathbf{p} + \mathbf{e}
]
其中:
- (\mathbf{y}) 为观测值向量;
- (\mathbf{b}) 为固定效应向量,如场、年、季、性别、胎次等;
- (\mathbf{u}) 为加性遗传效应向量,通常服从 (\mathbf{u} \sim N(\mathbf{0}, \mathbf{A}\sigma_a^2)),(\mathbf{A}) 为亲缘关系矩阵;
- (\mathbf{p}) 为永久环境效应向量,捕捉个体长期稳定的非遗传影响;
- (\mathbf{e}) 为临时环境效应或残差向量;
- (\mathbf{X})、(\mathbf{Z})、(\mathbf{W}) 为相应设计矩阵。
根据对遗传效应和永久环境效应随时间变化的假设不同,模型可进一步分为重复力模型和随机回归模型。
重复力模型与随机回归模型的对比
重复力模型
重复力模型假设个体的加性遗传效应和永久环境效应在所有时间点上保持相同,不随时间变化。其典型形式为:
[
y_{ij} = \mu + \text{固定效应} + a_i + p_i + e_{ij}
]
其中 (a_i) 为个体 (i) 的加性遗传效应,(p_i) 为永久环境效应,(e_{ij}) 为第 (j) 次测量的临时环境效应。
- 优点:模型简单,参数少,计算效率高,适用于时间点较少或性状相对稳定的情形。
- 局限:无法刻画遗传效应随时间的变化,也无法估计不同时间点间的遗传相关。
- 典型应用:奶牛多次产奶量记录、母猪产仔数重复记录、多年生作物的单株产量。
随机回归模型
随机回归模型允许遗传效应和永久环境效应随连续协变量(如时间、年龄、环境梯度)变化。其一般形式为:
[
y_{ij} = \text{固定效应} + \sum_{k=0}^{m} \phi_k(t_{ij}) a_{ik} + \sum_{k=0}^{m} \phi_k(t_{ij}) p_{ik} + e_{ij}
]
其中 (\phi_k(t_{ij})) 为关于时间 (t_{ij}) 的基函数,如 Legendre 多项式、B 样条或线性样条;(a_{ik}) 和 (p_{ik}) 分别为个体 (i) 的随机回归系数。
- 优点:能够估计遗传力随时间的变化曲线,计算任意时间点间的遗传相关,适合分析生长曲线、泌乳曲线等动态性状。
- 局限:模型复杂,对数据量和计算资源要求较高,基函数阶数选择需要谨慎。
- 典型应用:猪和牛的体重生长曲线、奶牛泌乳曲线、林木逐年生长量。
横向对比要点
- 假设差异:重复力模型假设遗传效应恒定;随机回归模型允许遗传效应随协变量变化。
- 输出差异:重复力模型给出单一遗传力和重复力;随机回归模型给出遗传力函数和遗传相关矩阵。
- 数据要求:随机回归模型通常需要每个个体有足够多的观测点,且时间分布覆盖较广。
- 计算成本:随机回归模型远高于重复力模型,尤其当随机效应维数增加时。
应用全景
重复测量与纵向数据遗传分析在多个领域具有广泛应用:
- 动物育种:奶牛产奶量的多次测定、猪生长速度的周龄记录、蛋鸡产蛋量的连续记录。通过随机回归模型可制定更精准的选种策略。
- 植物育种:多年多点试验中,同一基因型在不同年份和地点的表现。重复力模型可用于估计品种的稳定性,随机回归模型可分析基因型与环境互作的时间趋势。
- 人类遗传学:纵向队列中身高、体重、血压等表型的重复测量,用于估计遗传对发育轨迹的影响。
- 水产与林业:鱼类体重的多次测量、林木胸径的逐年调查,帮助优化选择年龄和选择方法。
实践建议与注意事项
在实际分析中,建议关注以下要点:
- 明确时间协变量:选择合适的时间尺度,如日龄、泌乳天数或环境指数。
- 模型选择:可通过似然比检验、AIC 或 BIC 比较重复力模型与不同阶数的随机回归模型。
- 数据清洗:处理异常值、缺失值和极端时间点,避免对方差组分估计造成偏倚。
- 计算工具:常用软件包括 ASReml、BLUPF90、sommer、MCMCglmm 等,应根据模型复杂度和数据规模选择。
- 结果验证:采用交叉验证或预测能力评估,检验模型在独立数据上的表现。
小结
重复测量与纵向数据的遗传分析是连接数量遗传理论与育种实践的重要桥梁。在父主题层面,掌握混合线性模型框架、重复力模型与随机回归模型的横向对比,以及其在动物、植物和人类遗传学中的应用全景,能够为后续深入理解遗传力、遗传相关和育种值预测等子主题奠定坚实基础。实际分析中,应根据性状生物学特性、数据结构和计算资源,合理选择模型并谨慎解释结果。