论文解读:ProteinBERT: a universal deep-learning model of protein sequence and function

本文介绍了ProteinBERT,一种基于自监督的深度学习模型,专门用于蛋白质序列分析。模型通过预训练在大规模蛋白质数据集上,结合序列恢复和GO注释预测任务,能有效捕获蛋白质的局部和全局表示。在多个蛋白质功能、结构和性质预测的基准测试中,ProteinBERT展现出接近最先进的性能,并能在不同长度的蛋白质序列上运行。研究还揭示了预训练时间和全局注意力机制对模型性能的影响。

作者单位:耶路撒冷希伯来大学
发表期刊:《Bioinformatics》,2020年期刊影响因子:6.937
发表时间:2022年1月9日
数据和代码: https://github.com/nadavbra/protein_bert

1. 研究背景

提出了一个基于自监督的ProteinBERT一个专门为蛋白质设计的深度语言模型。我们的预训练方案将语言建模与基因本体论(GO)注释预测结合起来。引入了新颖的建筑元素,使模型高效且灵活地适应长序列。ProteinBERT的体系结构由局部和全局表示组成,允许对这些类型的输入和输出进行端到端处理。ProteinBERT在涵盖多种蛋白质特性(包括蛋白质结构、翻译后修饰和生物物理属性)的多个基准上获得了接近最先进的性能,具有速度快,拟合速度好的优点。

2. 研究数据

2.1 预训练的蛋白质数据集

ProteinBERT在106M蛋白上进行了预训练UniProtKB/UniRef90,UniRef90提供了一组非冗余的蛋白质簇,至少共享90%的序列一致性。每个簇由一个具有代表性的蛋白质表示,确保蛋白质空间的相对均匀覆盖。对于每个蛋白质,提取其氨基酸序列和相关的氧化石墨烯注释(根据UniProtKB)。我们只考虑了在UniRef90中出现至少100次的8943个最频繁的GO注释。在106M的UniRef90蛋白中,46M至少有8943个被考虑的注释中的一个(在46M蛋白中平均每个蛋白有2.3个注释)。

2.2 蛋白质基准数据集

在9个基准数据集上对其进行了测试,包括蛋白质的功能、结构、翻译后修饰和生物物理特性(如下表所示)。这些基准中的标签要么是局部的(如翻译后修饰),要么是全局的(如远程同源性),它们要么是连续的(如蛋白质稳定性),要么是二元的(如信号肽),要么是分类的(如二

评论 5
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值