论文

MolSight:用于统一化学图像理解的图形感知视觉语言模型

MolSight: A Graph-Aware Vision-Language Model for Unified Chemical Image Understanding

应用与实践科学研究

摘要

使用分子 大语言模型 (LLM) 作为理解分子结构和功能的统一框架正在成为分子设计和药物发现等任务的新趋势。然而,这些模型难以完全捕捉分子结构的视觉表示,限制了它们的潜力。虽然现有的分子视觉语言模型(VLM)显示出前景,但它们仍然面临结构对齐方面的挑战,并且缺乏准确分子理解所需的拓扑模型。为了解决这个问题,我们提出了 MolSight,这是一种图形感知视觉语言模型框架,旨在增强 VLM 对分子图像的理解。 MolSight 集成了一个分子拓扑模块,用于将化学键邻接信息注入视觉标记,还集成了一个分子语义对齐模块,用于将视觉特征与化学符号语义对齐。我们的实验表明,MolSight 在多个化学视觉理解任务中显着优于现有的 VLM、分子 LLM 和任务特定模型,在复杂的化学场景中实现了分子图像推理的新水平。