论文

M^4olGen:精确多属性约束下的多智能体多阶段分子生成

M^4olGen: Multi-Agent, Multi-Stage Molecular Generation under Precise Multi-Property Constraints

模型训练强化学习RLVR

摘要

生成在多个理化性质上满足精确数值约束的分子既关键又具挑战性。尽管大语言模型(LLM)表达能力强,但在缺乏外部结构与反馈时,它们难以实现精确的多目标控制与数值推理。我们提出 M^4olGen,一个面向多属性约束分子生成的片段级、检索增强两阶段框架。阶段一为原型生成:多智能体推理器执行以检索为锚点的片段级编辑,产生靠近可行域的候选。阶段二为基于强化学习的细粒度优化:经 Group Relative Policy Optimization(GRPO)训练的片段级优化器执行一跳或多跳精修,显式最小化相对目标的性质误差,同时调控编辑复杂度及其与原型的偏离。一个大规模、自动整理、包含片段编辑推理链与实测性质变化的数据集支撑两个阶段,实现确定性的、可复现的监督与可控的多跳推理。与既有工作不同,我们的框架通过利用片段更好地对分子进行推理,并支持朝数值目标的可控精修。在两组性质约束(QED、LogP、分子量与 HOMO、LUMO)下的生成实验显示,框架在有效性与多属性目标的精确满足上一致提升,优于强 LLM 与基于图的算法。

M^4olGen:精确多属性约束下的多智能体多阶段分子生成
图1:M 4 olGen 的流程图。前两个模块涉及 Retrieval(检索)与 Prototyping(原型构建),其中首先根据给定约束(QED、LogP、MW)检索分子候选,然后由本地推理器(local reasoner)分析,以抽取约束、分析检索到的分子,并基于评估器的反馈提出编辑计划,迭代生成原型。第三个模块描述 Multi-Hop Optimization(多跳优化),其中原型通过由 GRPO 训练的分子优化器执行的一跳(one-hop)与 n 跳(n-hop)可控编辑步骤得到优化。