论文

用于单步逆合成的训练化学合理性感知 大语言模型

Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis

模型训练强化学习

摘要

单步逆合成是计算机辅助合成规划的核心组成部分,但单一答案评估和基准测试协议很难捕获其本质上一对多的性质。为了解决这个问题,我们引入了 Top-K 提示作为一种强大的训练和推理范例,以更好地捕获多样化、合理的反应预测。我们编译了 CREED-CCV-2+USPTO-XL,这是一个包含约 4560 万个经过验证的反应的超大规模数据集,用于训练 C3LM(化学约束一致语言模型)。通过将 微调 与基于 ChemCensor 和新颖性的奖励相集成,我们的模型在 OOD URSA-expert-2026 基准上实现了最先进的性能。对反应独特性的进一步分析表明,LLM 和传统模型探索了互补的反应空间,激发了基于集成的逆合成系统。总体而言,我们的结果将 Top-K 合理性感知训练确立为未来基于 LLM 的稳健综合规划的实用新方向。