生信论文解读-Accurate prediction of molecular properties and drug targets using a self-supervised image...

本文为博客 VIP 文章,开通 VIP 后可阅读全文

开通 VIP

药物的临床效率以及安全性由它的分子性质和靶点来决定

ImageMol framework --- pretrain chemical representations.从没有标记的分子图像里预训练化学表示

分子表示学习:

一维:simplified molecular-input line-entry system (SMILES)、International Chemical Identifier (InChI)

二维:two-dimensional (2D) graphs

三维:Image

如题目所表达的,ImageMol实现了两件事:

1. accurate prediction of molecular properties. 预测分子特性(药物的代谢、脑滲透、毒性)

2. accurate prediction of drug targets. 预测分子靶标(分泌酶、激酶)

并提出两个重要improvements:

1. 它利用分子图像作为特征表示的组合,提高准确率以及降低计算成本

2.探索了一个无监督预训练学习框架来捕获分子图像的结构信息---从人类蛋白质组一千万有多样生物活性的drug-like化合物中

做这件事的motivation是:

The increasing cost of drug development resulted from lack of efficacy of the randomized controlled trials, and the unknown pharmacokinetics and safety profiles of candidate compounds. 缺乏有效的随机对照试验,以及对药代学与安全性未知-- 导致--药物开发成本增加

缺乏药物相关知识背景,这里找gpt解释一下什么是药代动力学(Pharmacokinetics,PK):

Scaffold Split在分子属性预测中的优势与实践(附代码解析) 本文深入探讨了Scaffold Split在分子属性预测中的核心优势与实践方法。针对Random Split在评估模型面对全新分子骨架时泛化能力的不足,Scaffold Split通过依据分子骨架划分数据集,提供了更贴近真实药物研发场景的严格评估标准。文章详细解析了其原理,并附有完整的代码实现与避坑指南,帮助读者构建更具鲁棒性的AI药物发现模型。 阅读详情

相关推荐

数据集划分与采样策略:构建更稳健的药物预测模型

例如,有活性分子可能只占数据集的5%,而其余95%为非活性分子。✅ 建议:在药物建模任务中,优先采用 Scaffold-based split,尤其是在论文或项目报告中,需要对模型的泛化能力有明确评估时。科学合理地处理训练、验证、测试数据,能够有效提升模型的泛化能力,并避免过拟合或评估偏差。📌 示例:你训练的模型可能在测试集上达到95% AUC,但换一个数据集,AUC 直接掉到70%,因为它只是“记住了”结构而已。可能会造成“息泄露”,单纯的随机划分可能会让测试集与训练集之间高度相似,导致模型测试性能。

qq_39889473的博客 1131

Nature子刊:精准预测分子性质和药物靶标的无监督学习框架

药品的临床疗效与安全性由在人类蛋白质组内的分子靶标决定。本文中,湖南大学息科学与工程学院的李肯立/曾湘祥教授课题组提出了一种无监督的预训练深度学习框架,对 1000 万个未标记的类药性、物活性分子进行预训练,以预测候选化合物的药物靶标和分子性质。论文标题:Accurate prediction of molecular properties and drug targets using a s...

Paper weekly 1468

RDKit实战:用Scaffold Split提升分子属性预测模型的泛化能力(附Python代码)

本文详细介绍了如何利用RDKit中的Scaffold Split技术提升分子属性预测模型的泛化能力,包括实现原理、Python代码示例及实际项目效果对比。通过Scaffold Split,模型能更好地预测全新分子骨架,适用于药物发现和材料科学领域,显著提升真实场景中的预测准确性。

weixin_30300225的博客 209

使用自监督图像表示学习框架精确预测分子性质和药物靶点(Accurate prediction of molecular properties and drug targets using a sel)

ImageMol原文的阅读笔记和心得,该论文开创性地将视觉领域的算法引入到药物发现当中

qq_45776962的博客 627

DeepChem手册3.12 分割器

3.12 Splitters DeepChem的dc.splits.Splitter对象是分割DeepChem数据集以进行机器学习的有用工具。核心思想是,当评估机器学习模型时,从源数据产训练集,验证集,测试集是非常有用的。训练集用于训练模型,验证集用于评价不同的模型架构。测试集最后用于评估模型的性能。 dc.splits模型包括科学的分割器。很多情况下,我们需要更多的评估科学的深度学习模型比标准的深度模型,因为我们要寻找新领域的泛化能力。这里的一些分割器是有用的。 Contents Genera.

lishaoan77的专栏 821

DeepChem教程8:处量分割器

DeepChem教程8:处量分割器 使用机器学习时,你通常要将你的数据分为训练集,验证集,测试集。MoleculeNet加载器可以自动的处理这些。但是你要如何分割数据呢?这个问题刚开始看简单,但是后面会变得复杂。有许我种方法分割数据,选择哪一种方法会对结果的可靠性造成很大的影响。本教程介绍一些DeepChem提供的分割方法。 Splitters 在DeepChem中,将样本分为多个数据集的方法由Splitter对象确定。对你的数据选择合适的方法是非常重要的。否则,你的训练模型看起来会比它实际工作得要好

lishaoan77的专栏 1389

Briefings in bioinformatics2022 | ATMOL+:基于Attention-wise mask graph的对比学习以预测分子性质

Briefings in bioinformatics2022 | ATMOL+:基于Attention-wise mask graph的对比学习以预测分子性质

justBeHerHero 2092

学术速运|使用自监督图像表示学习框架准确预测分子性质和药物靶点

Accurate prediction of molecular properties and drug targets using a self-supervised image representation learning framework

weixin_45468600的博客 296

Accurate prediction of molecular targets using a self-supervised image rep...论文解读

Accurate prediction of molecular targets using aself-supervised image representation learningframe

Drug discovery 2116

文献阅读《Self-Supervised Graph Transformer on Large-Scale Molecular Data》

这篇文章是腾讯AI Lab和清华大学合作,投稿在2020年NeurlPS上的文章,主要的工作是设计了一个预训练模型,能够在大规模的无标签的化学分子数据上进行自监督训练,使得模型在下游任务的泛化性更强。接下来进入这篇文章的大概解读。 一、任务背景 在人工智能驱动的药物设计和发现中,如何获得分子的息表示是至关重要的先决条件。近年来,很多研究将分子抽象为图(Graph),并使用图神经网络(GNNs)进行分子表示学习。但是有两个问题阻碍了GNNs在真实场景中的使用:(1)用于监督训练的有标签分子数据不足;(2.

EE呈双的博客 3445

Accurate prediction of molecular targets using a self-supervised image rep...(代码理解)

Accurate prediction of molecular targets using a self-supervised image rep...(代码理解)

Drug discovery 1055

谷歌BERT预训练源码解析(三):训练过程

目录前言源码解析主函数自定义模型遮蔽词预测下一句预测规范化数据集 前言 本部分介绍BERT训练过程,BERT模型训练过程是在自己的TPU上进行的,这部分我没做过研究所以不做深入探讨。BERT针对两个任务同时训练。1.下一句预测。2.遮蔽词识别 下面介绍BERT的预训练模型run_pretraining.py是怎么训练的。 源码解析 主函数 训练过程主要用了estimator调度器。这个调度器支持自...

weixin_39470744的博客 1万+

Split的3种用法

我们可以把12     33   456    12342  拼起来就是一个字符,因为很多时候我们觉得处理只有几个组的时候用数组很麻烦所以我们用“|”或者“,”等等把他们拼起来在需要的时候用Split打散即可。//清清月儿 http://blog.csdn.net/21aspnet/ 下面列举一些用法,不做性能分析了。 方法一: static void Main(string[] a

秦秋雨的专栏 1320

基于WGS和CBC测序策略的DNA序列拼接算法研究(六)

4.3.1  程序的结构Atlas-prep-read1.create index file atlas-createindex(perl程序)2.split fasta and quality files into 20,000 reads sub files if necessary then screen and trim       1)atlas-divide

zhanghu1228的专栏 2263

用python统计scaffold的N50等

最近用python编写了统计scaffoldN50和contigN50等息的脚本。 运行结果截图如下: 源代码如下: #!/usr/bin/env python #func: cal N50,N60,N70,N80,N90,final import os,sys import operator import datetime import re from optpars

tangxc10的专栏 6706

Flutter中的Scaffold组件

概述 在开始说明Scaffold组件之前,先大致讲述一下Material Design风格。Material Design也成为纸墨设计风格,是由Google退出的全新的设计语言,这种设计语言旨在为手机、平板电脑、台式机和其他平台提供更一致、更广泛的外观和感觉,它是一种非常有质感的设计风格,并会提供一些默认的交互动画。 Scaffold实现了基本的Material Design布局。只要是在Mat...

wangzunkuan的博客 2206

论文速读)EDiT:用线性压缩注意力加速扩散 Transformer

本文提出了一种高效扩散Transformer架构EDiT,通过创新的线性压缩注意力机制解决传统DiT在成高分辨率图像时的计算瓶颈。EDiT采用卷积增强的线性注意力(ConvFusion+SpatialCompressor)处理图像自注意力,同时为多模态场景设计混合注意力方案,仅对图像-图像交互进行线性化处理,保留文本相关交互的标准注意力。实验表明,EDiT在PixArt-Σ和Stable Diffusion3.5-Medium上实现高达2.2倍的加速,同时保持接近原始模型的成质量。该方法的核心创新在于针

LJ1147517021的博客 268
上一篇: 集群服务器如何安装tensorflow-gpu
下一篇: 生信论文解读——Chemical structure-aware molecular image representation learning
混入生信圈的yu
博客等级 码龄8年 56粉丝 16原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值