
一、文章介绍
逆合成(retrosynthesis)是有机合成和药物发现中的核心问题,其目标是从目标产物分子出发,找到能够合成该产物的反应物集合。这一任务面临着巨大的化学搜索空间和无数的分子组合,传统上高度依赖化学家的大量专业知识和经验,效率低下。近年来,数据驱动的深度学习方法在逆合成预测领域取得了显著进展,特别是无模板(template-free)方法——将逆合成视为序列到序列的机器翻译任务,直接从产物SMILES生成反应物SMILES,避免了预定义模板覆盖度有限和可扩展性差的问题。
然而,现有逆合成方法普遍存在一个关键局限:它们主要依赖1D SMILES序列或2D分子图,缺乏对3D构象信息和分子空间结构的显式编码。这一缺失可能导致两个严重问题:第一,难以准确建模对立体化学敏感的化学反应(如手性和空间约束),容易产生立体化学不一致或构型不合理的反应物预测;第二,对于具有丰富3D结构的多手性中心或杂芳香族化合物,模型的鲁棒性明显下降。虽然已有研究表明3D构象信息在分子性质预测和药物设计中至关重要,但将其有效地整合到逆合成模型中面临两大挑战:(1)如何整合3D特征的同时保持原子token与对应3D表示之间的语义对齐;(2)如何基于空间距离约束注意力机制的感受野,使其更好地反映分子内部结构。
为攻克上述挑战,Jiaxi Zhuang、Yu Zhang及其合作者在Bioinformatics上发表了题为“ConfRetro: a Transformer-based template-free method integrating 3D conformer information for retrosynthesis prediction”的研究论文,提出了一个名为ConfRetro的新型端到端无模板逆合成模型。
ConfRetro的核心创新在于将分子3D构象信息无缝融入Transformer框架,通过两个精心设计的模块实现:(1)Atom-align Fusion(原子对齐融合) ——用ComENet从分子构象中提取每个原子的3D位置嵌入(包含径向距离、极角、方位角和旋转角信息),然后通过可训练参数λ1,λ2\lambda_1,\lambda_2λ1,λ2将3D位置嵌入与SMILES token嵌入自适应融合,并对非原子token位置补零填充,确保原子token与其对应的3D表示在模型输入阶段保持严格对齐。这避免了简单拼接破坏对齐的问题。(2)Distance-weighted Attention(距离加权注意力) ——从分子构象构建原子间距离矩阵Dij=∣∣ci−cj∣∣2\mathbf{D}_{ij}=||\mathbf{c}_i-\mathbf{c}_j||_2Dij=∣∣ci−cj∣∣2,通过高斯基函数将距离映射到高维空间,再经两层非线性层编码为3D距离权重Φ(i,j)\Phi_{(i,j)}Φ(i,j)。在Transformer编码器中,将注意力头分为普通头(学习序列上下文)和空间头(利用Φ(i,j)\Phi_{(i,j)}Φ(i,j)重新分配注意力权重,限制每个原子的感受野),并逐层用原子对上下文精炼3D距离权重。此外,ConfRetro还引入SMILES Alignment(SMILES对齐) 策略——利用反应中原子映射关系构建产物token与反应物token的对应矩阵,通过引导损失LSA\mathcal{L}_{SA}LSA强化解码器交叉注意力中对应token之间的权重,稳定解码过程。
在USPTO-50K和USPTO-FULL两个基准数据集上,ConfRetro在已知反应类和无反应类设置下均达到无模板方法的最新最优性能。在USPTO-50K无反应类设置中,Top-1准确率达56.2%(比最强基线NAG2G提升1.0%),Top-10达91.7%;Top-1 Round-Trip Accuracy达90.7%(比Retroformer提升12%),表明预测的反应物在化学上更加可执行。在更大的USPTO-FULL数据集上,ConfRetro同样取得最优性能。案例研究表明,对于多手性中心、杂芳香环、稠环/桥环等复杂结构分子,ConfRetro在Top-1或Top-2即可生成合理反应物,而基线方法常生成无效SMILES。在多步合成路线规划中,ConfRetro成功恢复了抗肿瘤药物喜树碱的12步完整合成路线。
二、算法原理介绍

ConfRetro的算法设计围绕“3D构象编码 → 原子对齐融合 → 距离引导注意力 → SMILES对齐监督”四个核心模块展开。
(一)3D构象编码与Atom-align Fusion。 对每个分子,用RDKit生成确定性3D构象(随机种子固定,MMFF94优化)。构象经ComENet提取原子级3D位置嵌入P3D∈RN×DP_{3D}\in\mathbb{R}^{N\times D}P3D∈RN×D(NNN为原子数,DDD为模型维度),ComENet在1跳邻域内通过消息传递编码径向距离ddd、极角θ\thetaθ、方位角ϕ\phiϕ和旋转角τ\tauτ:vit=g(vit,∑j∈Nif(vj,dij,θij,ϕij,τij))\mathbf{v}_i^t = g(\mathbf{v}_i^t, \sum_{j\in N_i} f(\mathbf{v}_j,d_{ij},\theta_{ij},\phi_{ij},\tau_{ij}))vit=g(vit,∑j∈Nif(vj,dij,θij,ϕij,τij))。SMILES token嵌入T∈RM×DT\in\mathbb{R}^{M\times D}T∈RM×D(MMM为token数)。Atom-align Fusion将P3DP_{3D}P3D通过补零扩展到MMM维,然后与TTT自适应融合:F3D=λ1×pad(P3D)+λ2×TF_{3D} = \lambda_1 \times \text{pad}(P_{3D}) + \lambda_2 \times TF3D=λ1×pad(P3D)+λ2×T,λ1,λ2\lambda_1,\lambda_2λ1,λ2为可训练参数。这保留了原子token与3D表示之间的语义对齐。
(二)Distance-weighted Attention。 在Transformer编码器的自注意力中,将hhh个注意力头分为两类。普通头按标准缩放点积计算;空间头利用3D距离重新分配权重。首先从分子构象计算距离矩阵Dij=∣∣ci−cj∣∣2\mathbf{D}_{ij}=||\mathbf{c}_i-\mathbf{c}_j||_2Dij=∣∣ci−cj∣∣2,通过KKK个高斯基函数映射:ψ(i,j)k=12π∣σk∣exp(−12(γ(i,j)dij+β(i,j)−μk∣σk∣)2)\psi_{(i,j)}^k = \frac{1}{\sqrt{2\pi}|\sigma^k|}\exp(-\frac{1}{2}(\frac{\gamma_{(i,j)}d_{ij}+\beta_{(i,j)}-\mu^k}{|\sigma^k|})^2)ψ(i,j)k=2π∣σk∣1exp(−21(∣σk∣γ(i,j)dij+β(i,j)−μk)2)(μk,σk\mu^k,\sigma^kμk,σk为高斯核中心和缩放,γ,β\gamma,\betaγ,β为与键型相关的可学习标量),再经两层非线性层编码为3D距离权重Φ(i,j)\Phi_{(i,j)}Φ(i,j)。空间头输出为:xi,spatiall=∑j∈N(i)softmax(Φ(i,j)l⊙qjkjTd)vj\mathbf{x}_{i,\text{spatial}}^l = \sum_{j\in N(i)}\text{softmax}(\Phi_{(i,j)}^l \odot \frac{q_j k_j^T}{\sqrt{d}})v_jxi,spatiall=∑j∈N(i)softmax(Φ(i,j)l⊙dqjkjT)vj,即注意力分数被Φ\PhiΦ逐元素重新加权,使模型聚焦于空间中邻近的原子。逐层用原子对上下文精炼权重:Φ(i,j)l=Φ(i,j)l⋅FC([hil;hjl])\Phi_{(i,j)}^l = \Phi_{(i,j)}^{l} \cdot \text{FC}([h_i^l; h_j^l])Φ(i,j)l=Φ(i,j)l⋅FC([hil;hjl])。
(三)SMILES对齐与损失函数。 利用反应中的原子映射构建SMILES对齐矩阵SAMij=1Ri↔PjSAM_{ij}=\mathbf{1}_{R_i \leftrightarrow P_j}SAMij=1Ri↔Pj。在解码器最后一层,计算交叉注意力分数与SAMSAMSAM之间的交叉熵损失LSA\mathcal{L}_{SA}LSA,强制对齐产物与反应物中的对应token。总损失为语言模型损失(含R-Drop的交叉熵和KL散度)与对齐损失之和:L=LLM(CE)+αLLM(KL)+βLSA\mathcal{L} = \mathcal{L}_{LM}^{(CE)} + \alpha\mathcal{L}_{LM}^{(KL)} + \beta\mathcal{L}_{SA}L=LLM(CE)+αLLM(KL)+βLSA。推理时用束搜索(beam size=10)生成反应物SMILES。
三、总结
ConfRetro是一个融合分子3D构象信息的端到端无模板逆合成预测Transformer模型,通过Atom-align Fusion实现SMILES token与3D位置嵌入的自适应对齐,通过Distance-weighted Attention利用原子间空间距离重新分配自注意力权重,并通过SMILES对齐监督强化产物-反应物对应关系。其核心创新在于:首次将3D构象信息系统性地整合到逆合成Transformer中,通过原子级对齐和距离引导注意力使模型能够感知立体化学和空间约束。ConfRetro在USPTO-50K和USPTO-FULL上达到无模板方法最优性能,在多手性中心、杂环等复杂分子上显著优于基线,并成功规划出喜树碱的可行多步合成路线,为计算机辅助合成规划在复杂药物分子中的应用提供了新的解决方案。

291

被折叠的 条评论
为什么被折叠?



