面向Google编程CHARLES ZHANG

AI DAILY / 2026-09-22

RetroChimera:用模型集成与学习排序提升小分子逆合成预测

Improving synthesis prediction of small molecules at scale with RetroChimera

进阶工作流Microsoft Research · 2026-09-21

全文中文翻译 · AI 生成,仅供学习交流

利用 RetroChimera 大规模改进小分子的合成预测

该论文描述了模型的架构以及广泛的验证研究,包括模型对罕见反应类型的召回能力,以及在专有数据集上的成功零样本迁移(zero-shot transfer)和微调(fine-tuning)。

我们以开源形式发布 RetroChimera 的实现与权重,希望它能帮助研究者加速开发新的药物相关分子和先进材料。

开发新药和新材料需要合成新分子,但规划合成路线在很大程度上仍然依赖人工,耗时且成本高昂。RetroChimera 能自动提出高质量的合成路线。该模型融合了两个各具优势、互补性强的模型,并学习如何对各自的预测进行排序,从而产出优于任一单独模型的预测结果。在盲测中,博士水平的化学家更青睐 RetroChimera 给出的单步反应预测,而非此前的模型以及文献中记录的反应。

定制分子正在推动现代医药、智能材料和可持续农业的进步。然而,进展却被化学合成所拖慢,在实验室中用更简单的构件合成新分子是一个耗时的过程。此外,合成也是药物开发成本的重要推手。因此,即使计算方法让人们得以探索大量新颖分子,如何找到实用的合成路径仍然是一项关键挑战。

原文配图

图 1:通过逆向方式规划合成路径。逆合成从目标分子出发,逐步提出向更简单前体的拆分,直到达到可购买的构件为止。高亮路径展示了一条完整的合成路线;浅色分支则示意沿途探索的备选方案。圆形代表分子,方形代表反应。为简洁起见,图中只展示了少数几个分支,并对目标分子、一个中间体以及部分构件给出了具体的化学结构。

逆合成通过从目标分子出发、逐步回推来解决这一问题,将其拆解为更简单的前体(图 1)。这一过程类似于下棋、围棋等策略类棋盘游戏:既要对每一步可能的"落子",也就是单步拆分,进行广泛考量,又需要高层次的战略思维来形成端到端的合成规划。不过逆合成中可能的"走法"远多于棋盘游戏,而且对于给定分子哪些走法可行并不显然。现有系统面临若干重大挑战,包括对罕见但具有战略意义的反应的召回能力、训练分布之外的稳健性,以及与化学家直觉的一致性。因此,逆合成往往需要高度专业的专家经验,阻碍了科学发现的可扩展性与自动化。

原文配图

图 2:我们基于集成与学习式重排序(learned re-ranking)的逆合成框架,也是 RetroChimera 的核心。集成系统以目标分子作为输入,由各个子模型分别处理;模型输出通过学习排序(learning-to-rank)策略进行聚合。虽然在本工作中我们仅考察深度学习模型作为预测源(实线方框),但也可以加入其他来源,例如反应数据库的调用或人机协同查询(虚线方框)。

在一篇近期发表于《Nature》期刊的论文中,我们介绍了 RetroChimera,一个用于逆合成预测的新框架。它由两个模型构成(图 2)。

R-SMILES 2 是一个基于 Transformer 的从头(de novo)生成模型,可直接从输入分子预测前体分子。这赋予了它直接从数据中学习反应模式的灵活性。然而,无约束的生成也使它较容易出现"幻觉"(hallucination,即生成貌似合理但并不真实的反应)。

相比之下,NeuralLoc 是一个基于图神经网络(Graph Neural Network,GNN)的模型,它将目标分子和反应模板都编码为图结构,并从中挑选反应模板、预测这些模板应施加在目标分子的何处。它的预测基于从训练数据中抽取的反应模式,因此往往更准确、更可靠;但在遇到模板库未覆盖的反应时则较为受限。

这两种差异实际上反倒成了一种优势。两个模型并非给出同质化的预测,而是捕捉了化学中互补的模式,各自在不同反应类型上各有所长。R-SMILES 2 在反应过程中变化幅度较大的反应上表现尤佳,而 NeuralLoc 则在低序反应(reactions of low precedence)以及涉及更局部变化的反应上更为出色。

RetroChimera 通过一种学习式的集成策略,将两个子模型的排序后预测加以结合。每个模型会为各组预测的前体赋予一个学习得到的、依赖于排名的"投票",当两个模型提出同一反应时这些投票会相加。通过学习在不同排序位次上对每个模型的信任程度,RetroChimera 能够发挥它们的互补优势,在各类反应上大致匹配表现更好的那一个子模型。

原文配图

图 3:专家对多步合成路线的评估。左图:单个反应步骤的评分。右图:在十个具有挑战性的目标上,整条路线被接受或拒绝的情况。RetroChimera 在九个目标上取得了成功,而从头生成模型为五个、编辑模型为四个,强基线模型 NeuralSym 仅两个。

因此,RetroChimera 在常见与罕见反应类别上均表现强劲,并能给出更贴合化学家判断的逆合成预测(图 3)。在盲测中,专家化学家更青睐 RetroChimera 对复杂分子给出的拆分方案,而不是其子模型的结果,也不是更成熟方法给出的结果,甚至优于测试集本身。

我们相信 RetroChimera 能帮助研究者更高效地识别有潜力的合成路线,从而在更广泛的分子科学应用,包括药物发现和智能材料设计,中加快"设计—合成—测试"(design-make-test)循环。RetroChimera 有望让化学家在大规模上评估更多、更复杂的候选分子。配合日益提升的实验室自动化水平,我们预期合成规划与执行的闭环、自改进系统将进一步加速。

RetroChimera 已在 GitHub 上发布(采用 MIT 许可证),并可通过 Microsoft Foundry 访问。关于如何获取模型检查点(checkpoint)的说明,请参见其 GitHub 仓库。

我们邀请更广泛的化学界同行来试用 RetroChimera,帮助我们发现它的优势与不足,以便在未来加以改进。我们期待听到它在各位关心的各类目标分子上的实际表现!

原文配图