论文笔记:DELPHI:预测蛋白质相互作用位点的精确深度集成模型

提出了一种新的基于序列的深度学习模型Delphi,用于预测蛋白质-蛋白质相互作用(PPI)结合位点。Delphi结合了CNN和RNN结构,并采用微调技术。在五个数据集上与九个现有方法进行了比较,结果显示Delphi在所有评估指标上均表现最优。

Web服务器:www.csd.uwo.ca/~yli922/index.php
特征计算流水线:github.com/lucian-ilie/DELPHI
联系邮箱: ilie@uwo.ca
补充资料:

摘要:

动机:蛋白质通常通过与其他蛋白质相互作用来发挥功能,这就是为什么准确预测蛋白质-蛋白质相互作用(PPI)结合位点是一个基本问题。实验方法既缓慢又昂贵。因此,人们正在努力提高计算方法的性能。
结果:我们提出了一种新的基于序列的深度学习预测PPI结合位点的方法–Delphi(深度学习预测高概率蛋白相互作用位点)。Delphi有一个集合结构,它结合了CNN和RNN组件,并采用了微调技术。除了现有的九个特性之外,还使用了三个新特性:HSP、位置信息和ProtVec。我们在5个数据集上综合比较了Delphi和9个最先进的程序,尽管Delphi的训练数据集与测试数据集的相似性最低,但Delphi在所有指标上都优于竞争对手的方法。在最重要的指标AUPRC和MCC上,它分别比第二好的程序高出18.5%和27.7%。我们还证明,这种改进本质上是由于使用了集成模型,特别是这三个新特性。用Delphi分析表明,这与蛋白质结合残基(PBR)和进化保守性强的位点有很强的相关性。此外,德尔福预测的PBR站点与Pfam的已知数据非常吻合。Delphi以开源独立软件和Web服务器的形式提供。

一、介绍

蛋白质-蛋白质相互作用(PPI)在许多细胞过程中起着关键作用,如信号转导、运输和新陈代谢(Zhang和Kurgan,2018)。蛋白质通过与其他蛋白质形成化学键相互作用。结合氨基酸残基是蛋白质相互作用的结合位点。检测PPI结合位点有助于理解细胞调控机制,定位药物靶点,预测蛋白质功能(Bonetta,2010)。像PDB(Berman等人,2002)这样的数据库存储从每个蛋白质的3D结构得到的蛋白质结合位点信息。
蛋白质-蛋白质相互作用(PPI)在许多细胞过程中起着关键作用,如信号转导、运输和新陈代谢(Zhang和Kurgan,2018)。蛋白质通过与其他蛋白质形成化学键相互作用。结合氨基酸残基是蛋白质相互作用的结合位点。检测PPI结合位点有助于理解细胞调控机制,定位药物靶点,预测蛋白质功能(Bonetta,2010)。像PDB(Berman等人,2002)这样的数据库存储从每个蛋白质的3D结构得到的蛋白质结合位点信息。
学习结构对PPI结合位点分类问题至关重要。以前探索的体系结构包括随机森林(魏等人,2016;Wang等人,2019年)、支持向量机(wei等人,2016)、Logistic回归(Zhang和Kurgan,2019年)、贝叶斯分类器(Murakami和Mizuguchi,2010)、人工神经网络(Singhet等人,2014)。最近,卷积神经网络(CNN)(曾等人,2019年)和递归神经网络(RNN)(张等人,2019a)也被应用于解决这一问题。
本文介绍了一种新的基于序列的PPI结合位点预测方法–Delphi(高概率蛋白相互作用位点的深度学习预测),该方法结合了CNN和RNN结构并结合微调技术。它使用12个特征组来表示蛋白质序列,包括三个新特征:高得分片段对(HSP)、位置信息和简化的3-聚氨基酸嵌入(ProTV Ec1d)。我们在5个数据集上综合比较了Delphi和9个最先进的程序。Delphi提供了所有指标中最好的预测。
DELPHI首先,构建了一种结合CNN和RNN的新型微调集成模型。其次,介绍了首次用于PPI结合位点预测的三个新特征。第三,提供了一个数据处理和特征构造套件,旨在减轻用户繁琐的特征计算的难度。
DELPHI对蛋白质结合位点的预测与高度进化保守的位点之间显示出很强的相关性。虽然这种关系并不是排他性的,但许多结合位点将被保守以维持蛋白质结构。三种不同的哺乳动物蛋白质证明了这一点。此外,德尔福的预测与Pfam数据库中已知的蛋白质结合残基(PBR)进行了比较,这与Pfam数据库中已知的蛋白质结合残基(PBR)非常一致。

二、材料和方法

(一)、数据库

遵循现代机器应用程序的开发流程,我们使用三组数据来训练和评估Delphi的性能:培训、验证和测试。该模型在训练数据上进行训练,并在验证数据上进行验证,以确保低方差,即避免过拟合。经过多次迭代调整,得到了模型,并在独立的测试数据上运行,然后报告了在测试数据上的性能。请注意,该模型在训练和验证过程中从不观察测试数据。

(二)、测试集

比较评估中使用了五个数据集。我们根据数据大小为它们命名:Dset_186、Dset_72、Dset_164、Dset_448和Dset_355。前四个是来自以前研究(Murakami和Mizuguchi,2010)(Dhole等人,2014)(Zhang和Kurgan,2019年)的公开可用的数据集,最后一个是Dset_355,是Dset_448的子集。DSET_186、DSET_72、DSET_164作为基准数据集已被众多出版物广泛使用和探索;DSET_448是较新的。
Dset_186和Dset_72是由Murakami和Mizuguchi(2010)构造的。DSET_186是在PDB收集(Berman等人,2002年)的基础上构建的,其中应用了六步过滤过程来提炼数据,包括去除缺失残基的结构、去除具有相同UniprotKB/Swiss-Prot的链、去除跨膜蛋白、去除二聚体结构、去除一定范围内具有埋藏表面可及性和界面极性的蛋白质以及消除相似性。DSET_72是基于蛋白质基准集3.0版(Hwanget et al.,2008)构建的,去掉了与DSET_186的相似性。
Dset_164是由Dholeet et al.(2014)用与Dset_186和Dset_72相同的过滤技术构建的,这些过滤技术与Dset_186和Dset_72自Dset_186(2010年6月至2013年11月)发表以来在PDB中新注释的蛋白质上的过滤技术相同。
DSET_448是由张和库尔根(2019年)构建的

评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值