论文
MolEmb:多模态大语言模型可以成为强大的分子嵌入模型
MolEmb: Multimodal Large Language Models Can Be Strong Molecular Embedding Models
摘要
分子嵌入模型可以作为计算化学和药物发现的基础设施,其中可复用的向量表示支持性质预测、虚拟筛选和检索。大多数分子编码器是围绕单一分子视图构建的专用模型,产生无条件向量,没有可用于改变表示的语言接口。我们问:原生处理图像、文本和符号输入的多模态大语言模型(MLLM),能否反过来充当通用的分子嵌入模型,产生以分子画像和自然语言语义上下文为条件的嵌入?我们提出MolEmb,一个轻量级框架,通过双向对比目标将分子画像与文本描述在共享嵌入空间中对齐,从而适配MLLM。所得嵌入模型在分子性质预测上具有竞争力,并支持在同一空间中进行跨模态分子-文本检索。我们进一步提出MolCAR——一个面向上下文感知检索的诊断基准——并发现上下文感知的分子嵌入主要是监督数据的一种属性。这些结果表明,MLLM不仅是化学助手或生成器,也是通往通用分子嵌入模型的一条可行且可扩展的路线。
