论文

大语言模型 的分子表示

Molecular Representations for Large Language Models

模型评测模型能力评测

摘要

大语言模型 (LLM) 越来越多地用于支持科学发现。在化学中,反应预测和结构阐明等任务需要对分子结构进行推理。因此,基于 LLM 的化学系统必须与分子结构可靠地相互作用。之前大多数化学领域的 LLM 研究都使用 SMILES 字符串或 IUPAC 名称作为分子表示;然而,这些格式的适用性尚未得到系统评估。在这项工作中,我们介绍了 MolJSON,一种 LLM 的新型分子表示形式,并将其与五种常见的化学格式进行系统比较。我们使用涵盖翻译、最短路径和约束生成推理任务的 78,045 个问题,使用 GPT-5-nano、GPT-5-mini、GPT-5 和 Claude Haiku 4.5 评估每个表示。我们观察到 LLM 解释和生成分子图的能力在各种表示形式上存在显着差异,其中 MolJSON 始终优于现有格式。在翻译任务中,GPT-5 将 IUPAC 名称转换为 MolJSON 时的准确率达到 71.0%,而将相同输入转换为 SMILES 时的准确率为 43.7%。对于约束生成,GPT-5 生成 MolJSON 的准确率达到 95.3%,而 IUPAC 为 76.3%,SMILES 为 64.0%。作为最短路径推理的输入格式,GPT-5 使用 MolJSON 成功回答了 98.5% 的问题,而 SMILES 为 92.2%,IUPAC 为 82.7%,同时使用的推理标记也较少。我们观察到与 SMILES 字符串和 IUPAC 名称的原子计数和环复杂性相关的系统错误,而 MolJSON 对这些故障模式更加稳健。我们的结果表明,分子表示的选择对 LLM 的性能有重大影响,并且显式分子图模式(例如 MolJSON)是基于 LLM 的化学系统的一个有前途的方向。