国内刊号:11-1985/S
国际刊号:0366-6964
发布日期:
作者:骞里, 梁忙, 邓天宇, 杜丽丽, 李柯安宁, 邱诗元, 薛青青, 张路培, 高雪, 徐凌洋, 郑彩宏, 李俊雅, 高会江
单位:1. 中国农业科学院北京畜牧兽医研究所, 北京 100193;2. 西北农林科技大学动物科技学院, 杨凌 712100;3. 黑龙江八一农垦大学, 大庆 163319
关键词:多组学数据,特征提取,机器学习,基因组预测
基金:国家重点研发项目(2024YFF1000102-5);国家自然科学基金(32172693)
为进一步探索传统线性回归模型难以捕捉基因型与表型之间复杂关系的不足, 本研究旨在利用机器学习整合组学数据提升基因组预测的准确性。本研究基于具有基因型与转录组数据的数据集:1)华西牛数据集涉及宰前活重、胴体重和净肉重3个主要经济性状;2)水稻数据集包含单株产量、每穗粒数和千粒重3个农艺性状。采用五折交叉验证,以皮尔逊相关系数评估育种值估计的准确性。首先比较了基于单一组学数据作为输入时的预测表现,随后基于自编码器构建隐含矩阵作为关系矩阵用于模型建模。结果表明,使用转录组数据替代基因组数据作为输入可以提升模型的预测能力。在水稻和华西牛数据集分别提高了44.2%和27.4%,进一步地,将隐含矩阵用于建模后,模型预测准确性相较基因组关系矩阵在水稻和华西牛中分别提升了4.10%和6.81%。相关性分析表明,隐含矩阵与原始组学数据之间存在较强的非线性关系。将转录组作为模型输入,结合自编码器构建的关系矩阵,可有效提升选种选育的准确性,为育种工作的持续改进提供参考依据。
来源:2025年第9期
《畜牧兽医学报》期刊编辑部