论文
MARCO:用于条件分子优化的多轮Agentic强化
MARCO: Multi-Round Agentic Reinforcement for Conditional Molecular Optimization
摘要
分子优化本质上是迭代的:提出候选分子,根据多个目标进行评估,并在保留与源分子的关系的同时进行修改。大多数指令遵循模型都会发出一种经过编辑的分子,从而将有效性、属性改进和相似性控制纳入单个响应中。我们引入了 MARCO,一个以评估者为基础的强化学习框架,可以在有界提案-反馈-修订轨迹上训练分子编辑器。 MARCO 聚合将奖励转变为未贴现的轨迹回报,以实现与群体相关的策略优化。我们评估此训练的两个结果:Same-1 在一个响应预算下测试经过训练的策略,而 Same-5 测试在最多五个响应可用时相同策略是否可以使用验证者反馈。在三目标 MuMOInstruct 基准、三个 Qwen 主干以及可见/不可见的指令拆分中,SFT 初始化的 MARCO 在每个报告的主要设置中获得了最高的属性成功率和相似性乘积。 Same-5 进一步提高了测试预算下的观察得分,而四目标和公共检查点实验则测试了跨约束集和初始化机制的转移。