论文

MolDA:基于大语言扩散模型的分子理解与生成

MolDA: Molecular Understanding and Generation via Large Language Diffusion Model

模型架构混合架构

摘要

大语言模型(LLM)显著推进了分子发现,但现有多模态分子架构从根本上依赖自回归(AR)主干。这种严格的从左到右归纳偏置对生成化学有效的分子并非最优,因为它难以顾及非局部的全局约束(例如环闭合),且在顺序生成过程中常会累积结构错误。为解决这些局限,我们提出MolDA(Molecular language model with masked Diffusion with mAsking),一种以离散大语言扩散模型替代传统AR主干的新型多模态框架。MolDA使用混合图编码器提取全面的结构表示,该编码器同时捕捉局部与全局拓扑,并通过Q-Former将其对齐到语言token空间。此外,我们专门针对掩码扩散从数学上重新表述了分子结构偏好优化(Molecular Structure Preference Optimization)。通过双向迭代去噪,MolDA在分子生成、描述(captioning)与性质预测上确保了全局结构连贯性、化学有效性与稳健推理。

MolDA:基于大语言扩散模型的分子理解与生成:论文配图
图 1:MolDA 架构概述。混合图形编码器(GINE + TokenGT)生成结构表示,Q-Former 将它们映射到语言模型标记空间,LLaDA 通过迭代去噪和低置信度重掩码生成响应。