
MOSES+:Molecular Sets,A Benchmarking Platform for Molecular Generation Models
最主要的是看分子生成的评价指标。现有新的生成方法有很多,论文中的方式有点老了。
一、INTRODUCTION
虽然生成模型有很多,但如何对它们进行比较和排序尚不清楚。在这项工作中,引入MOSES的基准测试平台来标准化分子生成模型的训练和比较。MOSES提供训练和测试数据集,以及一套用于评估生成结构的质量和多样性的指标。
药物敏感分子的数量在10^23到10^80个化合物之间

1、Distribution Learning
给定一组训练样本Xtr={xtr1,…,xtrN},从未知分布p(x),分布学习模型近似于p(x)和某些分布q(x)。
药物化学家可能期望某些亚结构在生成结构中更普遍。依靠一组手动或自动选择的化合物,分布学习模型产生一个更大的数据集,保留数据集中的隐式规则。分布学习模型的另一个应用是扩展下游半监督预测任务的训练集:可以通过从生成模型中抽样化合物来添加新的未标记数据。
Distribution Learning model是度量p(x)和q(x)之间的偏差,该模型可以隐式或显式地定义probability mass function q(x)。显式模型,如隐马尔可夫(Hidden Markov)模型、n-gram language模型或normalizing flows,可以解析计算q(x)并从中采样。隐式模型,如VAE、adversarial autoencoder或generative adversarial networks可以从q(x)中采样,但无法计算出probability mass function q(x)的确切值。为比较这两种模型,考虑的评价指标仅依赖于q(x)中的样本。
2、Molecular Representations

Strings:SMILES、DeepSMILES
Graph:Molecular graphs
3、Metrics
1)Fraction of valid (Valid) and unique (Unique@k)
生成的SMILES字符串的有效性和唯一性。K一般取1000或者10000,如果有效分子的数量小于K,则计算所有有效分子的唯一性。
Uniqueness检查模型是否崩溃(只产生几个典型分子),
2)Novelty
生成新分子中没有出现在训练集中的部分。低Novelty表明过拟合。
3)Filters
在数据集构建过程中通过filter的生成分子的比例。虽然生成的分子通常在化学上是有效的,但它们可能包含不需要的片段:在构建训练数据集时,我们删除了带有此类片段的分子,并期望模型避免产生它们。
4)Fragment similarity (Frag)
比较BRICS片段在生成集和reference集中的分布。
表示cf (A)表示子结构f在集合A的分子中出现的次数,表示在G或R中出现的片段集为f,Frag metric用余弦相似度计算:

如果两组分子有相似的片段,则Frag metric较大。如果某些片段在生成集中表示过多或不足(或从未出现),则度量值将较低。这个度量的极限是[0,1]。
5)Scaffold similarity (Scaff)
比较frequencies of Bemis–Murcko scaffolds ,包含所有分子的环结构和连接环的连接子片段。使用RDKit,额外考虑碳基(carbonyl groups)连接到环作为scaffolds 的一部分。用cs(A)表示scaffolds s在集合A中的分子中出现的次数,用G或R中出现的片段集表示s,metric定义为余弦相似度:

目的是显示生成数据集和reference集中的支架有多相似,范围为:[0,1]。
片段和支架的相似性都是在子结构水平上比较分子的。因此,即使G和R包含不同的分子,也有可能有一个相似的分子。
6)Similarity to a nearest neighbor (SN

博客介绍了MOSES基准测试平台,用于标准化分子生成模型的训练和比较。它提供训练和测试数据集及评估指标,如有效性、唯一性、新颖性等。还提及分布学习模型、分子表示方式,以及数据集划分和基线模型,包括CharRNN、VAE等。

8623

被折叠的 条评论
为什么被折叠?



