论文

重新思考 LLM 的分子文本表示:一项实证研究

Rethinking Molecular Text Representations for LLMs: An Empirical Study

模型评测模型能力评测

摘要

大语言模型 (LLM) 越来越多地用于分子任务,但仍不清楚使用哪种分子表示。我们提出了一个系统基准,评估 LLM 跨九种表示和八种化学任务的分子能力。我们对五个模型系列中的 16 个 LLM 进行了基准测试,包括推理和非推理变体、化学专用 LLM 和封闭前沿模型。性能强烈依赖于表示,并且没有单一的表示能够胜过任务,尽管 CML 是最好的,其次是 MolJSON、InChI,然后是规范的 SMILES。显式结构化文本表示(CML 和 MolJSON)主导结构任务; IUPAC 在语义任务中占据主导地位,赢得了所有 16 个 LLM 的分子检索;尽管 SMILES 变体在预训练中很普遍,但它们很少是最佳的。化学专业模型在 SMILES 上表现良好,但代价是结构化文本表示的大幅退化,这表明仅 SMILES 的评估会奖励不泛化的专业化。使用 LLM 作为判断者,我们发现 IUPAC 产生的正确分子生成比例最高。通过标记化审核、线性探测和注意力进行的机制研究表明,模型内部的表示编码方式不同;例如,结构化表示需要在分子跨度上给予更多关注。我们的结果反对表示不变的评估,并激发了基于 LLM 的化学的任务感知表示路由。