论文

面向性质预测的多粒度理据引导分子大语言模型

Multi-Granular Rationale-Guided Molecular LLM for Property Prediction

上下文与知识上下文工程

摘要

大语言模型(LLM)被广泛应用于化学任务,例如支撑药物发现的分子性质预测。分子LLM通过多种模态表示分子,典型的是一维SMILES序列或二维分子图。两者都隐式编码分子信息,因此单个子结构的贡献仍不透明。检索与增强方法会增加上下文,但来自外部来源。然而,化学家推理所依据的线索是驱动性质升降的内部子结构。我们提出MR-MoL,一种直接提供这种证据的多粒度理据引导分子LLM。微调的GNN通过掩码为每个子结构打分,最具影响力的子结构被序列化为带排序与方向标记的理据,LLM在读取SMILES序列和分子图的同时读取该理据。理据跨越三个粒度层级:带侧链的Murcko骨架、BRICS片段和官能团。据我们所知,这是首个将GNN来源的归因作为性质预测证据暴露给LLM的方法。在八个MoleculeNet任务上,MR-MoL在通用模型中取得最佳总体结果,并缩小了与为每个任务调优的专用模型的差距。五项诊断进一步证实模型确实读取了理据,而不仅是受益于其存在:理据的方向、排序和子结构各自塑造预测,且其归因再现了已知的构效关系。

面向性质预测的多粒度理据引导分子大语言模型:论文配图
图1:MR-MoL概览。图嵌入路径通过图编码器和投影器编码二维分子图,产生分子token。理据路径对源预测器施加子结构掩码,依据归因对子结构评分。得分最高的子结构构成多粒度理据的条目,与指令、SMILES和分子token一起提供给LLM,由模型生成任务答案。