论文

MolSC:利用取代基贡献增强大语言模型的细粒度分子理解

MolSC: Leveraging Substituent Contributions to Enhance Fine-grained Molecular Understanding in LLMs

模型训练监督微调与指令调优

摘要

自然语言处理的最新进展使得分子大语言模型 (LLM) 在各种化学任务中具有强大的性能。然而,他们仍然难以捕捉细粒度的结构-性质关系,特别是微小的局部修饰如何改变分子的行为。为了解决这一限制,我们引入了 MolSC,这是一个取代基贡献数据集,定义为通过将特定取代基附着到分子支架上而引起的性质变化。 MolSC 根据手动注释的生物活性记录进行整理,涵盖结构警报责任、特定目标生物活性和理化描述符,并包含 181K 个取代基级别的训练示例。我们进一步提出了 MolSC-Bench,这是一个在支架、取代基和分子水平上与 MolSC 不相交的 1,541 个实例的保留评估基准。我们的实验表明,现有的分子大语言模型和强大的专有模型(例如 GPT-5.2 和 Gemini-3-Flash)在取代基贡献预测方面表现出有限的可靠性。相比之下,MolSC 训练大大提高了这种能力,并在不同的下游分子任务中取得了出色的表现。这些结果强调取代基贡献学习是细粒度分子理解的关键组成部分。