论文
更大的模型真的能在药物发现中获胜吗?人工智能驱动的分子性质和活性预测中模型缩放的基准评估
Do Larger Models Really Win in Drug Discovery? A Benchmark Assessment of Model Scaling in AI-Driven Molecular Property and Activity Prediction
摘要
分子基础模型和 大语言模型 (LLM) 的快速增长鼓励了药物发现中人工智能以规模为中心的观点,其中更大的预训练模型预计将取代紧凑的化学信息学模型。我们在 26 个 ADME、毒性和生物活性终点测试了这一假设,涵盖 165,541 个终点级化合物标签记录。该基准包含在随机、Murcko 支架和结构分离的 5 倍交叉验证协议下评估的 78 个终点和分割条目,代表着化学泛化难度的增加。在 156 项任务和指标比较中,经典机器学习 (ML) 提供了最佳表现条目的最大份额 (47.4%),其次是预训练分子序列模型 (28.8%)、图神经网络 (21.8%) 和基于 LLM 的 SAR 基线 (1.9%)。经典机器学习在随机分割插值中占据主导地位,并且仍然是最大的赢家。 GNN 和序列模型在选定的较难分割中具有竞争力,但在固定的最终窗口读数下,它们严格的获胜者份额会减少,这表明对训练设置和模型选择的敏感性。配对引导分析表明,各个模型之间微小的数值差异不应被视为决定性的胜利。训练折叠中的 SAR 知识改进了 GPT5.5-SAR 和 Opus4.7-SAR 指标,但并没有使基于规则的推理成为监督预测器的通用替代品。紧凑的专业模型仍然非常有效,预测性能取决于模型、任务和验证场景之间的配合,而不仅仅是规模。