论文

用于分子特性上下文预测的表格基础模型

Tabular foundation models for in-context prediction of molecular properties

模型评测模型能力评测

摘要

准确的分子特性预测对于药物发现、催化和工艺设计至关重要,但现实世界的应用往往受到小数据集的限制。分子基础模型通过学习可转移的分子表示提供了一个有前途的方向;然而,它们通常涉及特定于任务的 微调,需要机器学习专业知识,并且通常无法超越经典基线。表格基础模型 (TFM) 提供了一种根本不同的范式:它们通过上下文学习执行预测,无需特定任务的训练即可进行推理。在这里,我们通过标准化制药基准和化学工程数据集在低到中等数据范围内评估 TFM。我们评估冷冻分子基础模型表示以及经典描述符和指纹。在所有基准测试中,与 微调 相比,该方法显示出出色的预测性能,同时降低了计算成本,这些优势也转移到了实际的工程数据设置中。特别是,将 TFM 与 CheMeleon 嵌入相结合,可以在 30 个 MoleculeACE 任务中获得高达 100% 的获胜率,而紧凑的 RDKit2d 和 Mordred 描述符提供了强大的基于描述符的替代方案。分子表示成为 TFM 性能的关键决定因素,分子基础模型嵌入和 2D 描述符集在许多任务上都比传统分子指纹提供了实质性的改进。这些结果表明,使用 TFM 进行上下文学习为实际应用中的属性预测提供了一种高度准确且经济高效的替代方案。