目录
作者单位:耶路撒冷希伯来大学
发表期刊:《Bioinformatics》,2020年期刊影响因子:6.937
发表时间:2022年1月9日
数据和代码: https://github.com/nadavbra/protein_bert
1. 研究背景
提出了一个基于自监督的ProteinBERT一个专门为蛋白质设计的深度语言模型。我们的预训练方案将语言建模与基因本体论(GO)注释预测结合起来。引入了新颖的建筑元素,使模型高效且灵活地适应长序列。ProteinBERT的体系结构由局部和全局表示组成,允许对这些类型的输入和输出进行端到端处理。ProteinBERT在涵盖多种蛋白质特性(包括蛋白质结构、翻译后修饰和生物物理属性)的多个基准上获得了接近最先进的性能,具有速度快,拟合速度好的优点。
2. 研究数据
2.1 预训练的蛋白质数据集
ProteinBERT在106M蛋白上进行了预训练UniProtKB/UniRef90,UniRef90提供了一组非冗余的蛋白质簇,至少共享90%的序列一致性。每个簇由一个具有代表性的蛋白质表示,确保蛋白质空间的相对均匀覆盖。对于每个蛋白质,提取其氨基酸序列和相关的氧化石墨烯注释(根据UniProtKB)。我们只考虑了在UniRef90中出现至少100次的8943个最频繁的GO注释。在106M的UniRef90蛋白中,46M至少有8943个被考虑的注释中的一个(在46M蛋白中平均每个蛋白有2.3个注释)。
2.2 蛋白质基准数据集
在9个基准数据集上对其进行了测试,包括蛋白质的功能、结构、翻译后修饰和生物物理特性(如下表所示)。这些基准中的标签要么是局部的(如翻译后修饰),要么是全局的(如远程同源性),它们要么是连续的(如蛋白质稳定性),要么是二元的(如信号肽),要么是分类的(如二

本文介绍了ProteinBERT,一种基于自监督的深度学习模型,专门用于蛋白质序列分析。模型通过预训练在大规模蛋白质数据集上,结合序列恢复和GO注释预测任务,能有效捕获蛋白质的局部和全局表示。在多个蛋白质功能、结构和性质预测的基准测试中,ProteinBERT展现出接近最先进的性能,并能在不同长度的蛋白质序列上运行。研究还揭示了预训练时间和全局注意力机制对模型性能的影响。

1542

被折叠的 条评论
为什么被折叠?



