论文

通过关系感知多模态协作改进大分子语言模型

Improving Large Molecular Language Model via Relation-aware Multimodal Collaboration

模型架构Transformer

摘要

大语言模型(LLM)已展示其指令遵循能力,并在多种任务上取得强大性能。受其成功启发,分子领域的近期工作催生了将一维分子字符串或二维分子图集成到语言模型中的大分子语言模型(LMLM)。然而,现有 LMLM 常受幻觉与稳健性有限的困扰,主要归因于对一维序列、二维分子图与三维构象等多样的分子模态整合不足。为解决这些局限,我们提出 CoLLaMo,一个配备多层级分子模态协作投影器的基于大语言模型的分子助手。投影器中的关系感知模态协作注意力机制通过纳入二维结构与三维空间关系,促成原子之间细粒度、关系引导的信息交换。此外,我们提出以分子为中心的新型自动评测,包括幻觉评估指标与基于 GPT 的描述质量评估,以解决广泛用于评估 LMLM 分子理解的基于 token 的通用指标(即 BLEU)的局限。大量实验表明,我们的 CoLLaMo 增强了 LMLM 的分子模态泛化能力,在分子描述生成、计算性质问答、描述性性质问答、基元计数与 IUPAC 名称预测等多个任务上取得最佳性能。

通过关系感知多模态协作改进大分子语言模型
图1:CoLLaMo 的整体架构。我们的框架 CoLLaMo 由面向 1D SELFIES、2D 图与 3D 构象的编码器、分子模态协同投影器(molecular modality-collaborative projector)与大语言模型组成。我们的框架首先对 1D、2D 与 3D 分子表示进行编码,然后使用模态协同投影器将编码输出转换为统一的分子 token。最后,大语言模型在给定输入分子与指令的情况下生成响应。