论文

MolLingo:面向LLM科学智能体的分子原生表示

MolLingo: Molecule-Native Representations for LLM-Powered Scientific Agents

应用与实践上下文与知识记忆科学研究Agent记忆

摘要

我们提出MolLingo,一个模拟化学家推理过程以实现分子设计自动化的多智能体系统。现有基于LLM的方法要么作为无法访问外部工具的独立生成模型运行,要么缺乏在分子设计全流程中进行迭代式、证据驱动推理所需的多智能体协调与共享记忆。MolLingo通过共享记忆模块协调文献智能体(Literature Agent)、化学家智能体(Chemist Agent)与编排器(Orchestrator)来解决这一问题,并为每个智能体配备领域专用工具。为实现有效的分子推理,我们引入基于BRICS的片段枚举(BFE),这是一种合成感知的分子片段化方法,将分子分解为化学上有意义的构建单元,并以块状SMILES配合常见化学名称来表示。这种表示在分子结构与LLM语义空间之间架起桥梁,使块级推理与编辑成为可能,而这仅凭原始SMILES难以实现。作为早期药物设计的案例研究,MolLingo进一步将化学家智能体的推理锚定在由分子对接得到的结合位点几何结构与残基级蛋白质上下文上,以优化分子获得更强的靶标结合。在四个基准上,MolLingo持续优于前沿LLM和专用基线,包括:在底层模型相同的情况下对接分数较GPT-5.4提升四倍、在多个LLM骨干上取得一致的药物性质优化增益,以及在TOMG-Bench上取得最先进结果,同时超越前沿LLM和基于强化学习的优化方法RePO。我们的结果表明,当通过化学上有意义的表示和具有生物学依据的结构上下文加以引导时,LLM已经能够胜任分子设计辅助工作。代码可在https://anonymous.4open.science/status/MolLingo-7450获取。

MolLingo:面向LLM科学智能体的分子原生表示:论文配图
图 5:原始 SMILES(顶部)和具有通用名称的基于块的 SMILES(底部)的 Qwen2-Instruct-7B 注意力热图。每条线代表分子块的标记和描述生物功能的标记之间的平均注意力。原始 SMILES 产生随机的、非结构化的注意力,而基于块的表示在功能相关的块上产生强烈的局部注意力。