原文标题:Molecular Generation Using a Transformer-Decoder Model
地址:https://pubs.acs.org/doi/pdf/10.1021/acs.jcim.1c00600
代码地址:https://github.com/devalab/molgpt

模型大致架构:

一、问题
潜在的类药物候选分子的总数在1023 ~ 1060个之间,其中1个分子仅合成了108个左右。由于很难筛选实际上无限的化学空间,而且合成分子和潜在分子之间存在巨大的差异,生成模型被用于模拟分子的分布,以采样具有理想性质的分子。
二、模型方法
1、dataset
两个基准数据集,MOSES和GuacaMol,使用RDkit计算分子性质,并提取支架。
优化属性:logP、Synthetic Accessibility score (SAS50)【合成难度,1表示容易、0表示很难】、Topological Polar Surface Area (TPSA)【所有极性原子的表面积之和,测量药物穿透细胞膜的能力】、Quantitative Estimate of Drug-likeness (QED51)【考虑主要的分子特性来量化药物相似度。它的范围从0(所有属性不利)到1(所有属性有利)】
2、模型

为非条件训练时,分子smile首先被tokenizer使用SMILES tokenizer,然后对模型进行训练下个token预测任务。对于属性条件训练和骨架条件训练,使用RDkit从分子中提取分子属性和支架,并将它们作为条件与分子SMILES一起传递。对于生成,向模型输入一个start token,然后模型按顺序预测下个token,从而生成一个分子。start token是通过加权随机抽样从出现在训练集SMILES字符串中的token列表中获得的。这些token的权重由它们在训练集中SM


4158

被折叠的 条评论
为什么被折叠?



