论文

面向端到端逆合成规划的强化推理

Reinforced Reasoning for End-to-End Retrosynthetic Planning

模型训练强化学习RLVR

摘要

逆合成规划是有机化学中的一项基础任务,但由于其组合复杂性,仍然充满挑战。为解决这一问题,传统方法通常依赖将单步预测与外部搜索启发式相结合的混合框架,这不可避免地割裂了局部分子转化与全局规划目标之间的逻辑连贯性。为弥合这一差距,并将复杂的战略预见直接嵌入模型的化学推理,我们提出 ReTriP,一个将逆合成重新表述为直接思维链(Chain-of-Thought)推理任务的端到端生成框架。我们建立了路径连贯的分子表示,并采用从推理蒸馏过渡到带可验证奖励的强化学习的渐进式训练课程,有效对齐逐步生成与实际路线效用。在 RetroBench 上的实证评估表明,ReTriP 取得了最先进的性能,在长程规划中相比混合基线展现出更优的鲁棒性。

面向端到端逆合成规划的强化推理:论文配图
图1:逆合成范式对比:(a)解耦的搜索式方法;(b)本文统一的ReTriP框架。