植物基因组测序和组装技术正在快速迭代,高质量参考基因组数量呈指数级增长。获取序列只是第一步,准确的结构注释才是挖掘基因功能、开展比较基因组学和分子育种的基础。
目前的结构注释流程高度依赖转录组数据和同源蛋白证据。对于新测序物种或非模式植物,获取覆盖全时空表达谱的转录组数据成本极高。缺乏外部证据时,传统的从头预测工具在重复序列、活跃转座子以及复杂外显子内含子架构区域往往表现不佳。
近期,华中农业大学胡学海团队与华中科技大学团队合作在bioRxiv发布预印本:PlantGeneAnn: a strand-specific genome foundation model for ab initio gene structure annotation of plant genomes,推出植物基因组基础模型PlantGeneAnn。该模型专为植物基因组链特异性从头结构注释设计,在多个严苛基准测试中刷新了现有记录。

架构设计与反直觉的微调发现
PlantGeneAnn采用轻量级植物基因组语言模型PlantBiMoE作为序列编码器,后接空洞一维U-Net分割头和两个独立的链特异性分类头。模型仅输入正链基因组序列,即可同时预测正负链的蛋白质编码基因、外显子和编码区。
在模型优化阶段,研究团队测试了两种微调策略。一个在42个多样化植物物种的720亿个token上训练,另一个仅在9个高质量模式植物的180亿个token上训练。结果显示,9个物种版本的模型在所有特征的碱基级马修斯相关系数上均优于42个物种版本。这一结果证明,对于基于基因组语言模型的微调任务,注释数据的准确性比数据规模或物种数量更具决定性作用。

13物种严苛基准测试全面领先
为验证泛化能力,研究团队构建了一个包含13个物种的严格测试集,涵盖蔷薇类、菊类和单子叶植物。测试集刻意排除了所有对比模型训练集和预训练集中的物种,以彻底杜绝数据泄露。
在碱基、外显子、内含子、内含子链和转录本五个评估层级上,PlantGeneAnn与HelixerPost、ANNEVO、AUGUSTUS以及NTv3-650M-Post进行了全面对比。PlantGeneAnn在碱基级显著超越多数基线模型,在外显子和内含子层级显著优于所有对比工具。
内含子精确率是评估基因边界划分能力的关键指标。PlantGeneAnn在蔷薇类、菊类和单子叶植物中保持了0.880的平均内含子精确率,高于ANNEVO的0.813和HelixerPost的0.711。在要求所有连续内含子必须完全正确识别的内含子链层级,PlantGeneAnn同样显著领先。在转录本层级,其整体平均F1分数达到0.575,略高于ANNEVO,并在13个物种中的8个取得最高F1分数。这表明模型成功将预训练的基因组上下文信息转化为精确的链特异性外显子内含子边界解析能力。

零样本变异效应预测与单碱基敏感性
准确的注释模型应当能够反映序列变异带来的结构改变。研究团队在零样本设置下评估了PlantGeneAnn对序列变异结构后果的预测能力。
在玉米Bt2位点,一个靠近第三内含子5端剪接供体的G到A点突变破坏了保守剪接信号。PlantGeneAnn仅凭局部序列上下文,准确预测了上游隐蔽剪接供体的激活以及由此产生的9个核苷酸缺失,而其他工具未能做出相应调整。在水稻OsMADS1位点,粳稻品种中的一个15bp内含子替换与更长更饱满的籽粒相关。PlantGeneAnn捕获了剪接位点使用情况的改变,解析了编码区边界偏移,并预测了由此产生的蛋白质截短。
为验证这种能力的普遍性,研究团队对4个模式植物中8000个高度保守的剪接供体和受体位点进行了大规模计算机模拟饱和突变实验。PlantGeneAnn在剪接受体位点展现出强烈的单核苷酸敏感性,而ANNEVO对单核苷酸扰动的响应非常有限。这证明PlantGeneAnn学习的是剪接位点使用的上下文序列决定因素,而非依赖静态序列模式。

保留基础模型的泛化塑性
针对特定任务微调的模型容易退化为狭隘的专家模型。为验证PlantGeneAnn的泛化能力,研究团队在NTv3基准测试的植物子集上进行了表观基因组轨迹预测评估。该测试集包含4个物种的46个长上下文实验轨迹,涵盖Ribo-seq、RNA-seq和ATAC-seq。
PlantGeneAnn在测试集上的平均皮尔逊相关系数达到0.616。这一表现达到NTv3-650M-Pre模型同等水平,并显著超越NTv3-100M-Pre、PlantCAD2-88M、Evo2-1B以及专门用于注释的ANNEVO模型。结果证实,注释微调没有破坏模型的基础塑性,PlantGeneAnn同时具备顶尖的注释能力和高度泛化的基因组语言模型表征能力。

开源与硬件要求
PlantGeneAnn支持在实验室常规GPU上进行高效推理和微调,降低了日常使用门槛。模型代码、分析脚本以及两个微调版本的权重均已在GitHub(https://github.com/qzzhang0131/PlantGeneAnn)和Hugging Face开源(https://huggingface.co/qzzhang/PlantGeneAnn-model-plants)。对于缺乏转录组数据的新组装基因组、大规模泛基因组研究以及非模式植物,该模型提供了一个高准确度的从头注释解决方案。

355

被折叠的 条评论
为什么被折叠?



