论文

用于微笑和自然语言联合表示学习的双语义化学嵌入器

Bi-semantic Chemical Embedder for Joint Representation Learning of SMILES and Natural Language

模型训练预训练

摘要

Transformer 模型彻底改变了自然语言处理 (NLP),而基于文本的分子表示(例如 SMILES)已成功将这些架构扩展到化学领域。然而,领域自适应 预训练 通常会导致模型过度适应化学语法,从而灾难性地忘记其基本语义功能。为了应对这一挑战,我们引入了 CheMatE,这是一种面向化学的嵌入模型,可在同一表示空间内联合捕获分子结构和特定领域的自然语言。 CheMatE 基于 ModernBERT 主干网络构建,通过两阶段训练过程学习双语义表示:持续的掩码语言建模 (MLM),然后是通过多重负排序损失 (MNRL) 的俄罗斯套娃对比学习阶段。首先,我们在由 FineWeb 和 ChemPile(分别包含 10.4B 和 11.5B 标记)构建和策划的新颖、大规模 SMILES 注释的长上下文科学文档语料库上使用 MLM 训练模型。随后,该模型使用从我们原始训练语料库通过算法得出的 SMILES-文本对的合成数据集进行对比学习。该设计将模型暴露给富含 SMILES 的科学文献,从而实现双语义理解。我们评估 CheMatE 的一系列下游任务,包括分子特性预测和科学语言理解。我们的结果表明,将我们定制的数据集与这种顺序训练策略结合起来可以产生强大的、高度可转移的表示。通过在一个基于文本的框架内有效地统一结构和上下文信号,CheMatE 在专业化学模型和通用语言模型基线上实现了具有竞争力的性能。