论文

MolEmb:多模态大语言模型可以成为强大的分子嵌入模型

MolEmb: Multimodal Large Language Models Can Be Strong Molecular Embedding Models

应用与实践科学研究

摘要

分子嵌入模型可以作为计算化学和药物发现的基础设施,其中可复用的向量表示支持性质预测、虚拟筛选和检索。大多数分子编码器是围绕单一分子视图构建的专用模型,产生无条件向量,没有可用于改变表示的语言接口。我们问:原生处理图像、文本和符号输入的多模态大语言模型(MLLM),能否反过来充当通用的分子嵌入模型,产生以分子画像和自然语言语义上下文为条件的嵌入?我们提出MolEmb,一个轻量级框架,通过双向对比目标将分子画像与文本描述在共享嵌入空间中对齐,从而适配MLLM。所得嵌入模型在分子性质预测上具有竞争力,并支持在同一空间中进行跨模态分子-文本检索。我们进一步提出MolCAR——一个面向上下文感知检索的诊断基准——并发现上下文感知的分子嵌入主要是监督数据的一种属性。这些结果表明,MLLM不仅是化学助手或生成器,也是通往通用分子嵌入模型的一条可行且可扩展的路线。

MolEmb:多模态大语言模型可以成为强大的分子嵌入模型:论文配图
图1:从专用编码器到通用分子嵌入模型。(A) MLLM 转嵌入路线将分子表示从固定视角的专用编码器转向基于 MLLM 的嵌入接口,该接口接受多视角分子档案与自然语言任务指令。(B) MolEmb 通过分子–文本对比对齐,用轻量 LoRA 模块适配预训练 MLLM 来实例化该路线;EOS 隐藏状态被用作分子嵌入。(C) 由此得到的可复用嵌入接口通过改变任务指令,支持性质预测、跨模态分子–文本检索与上下文感知嵌入。