论文
Monroe:上下文概率推理的分子基础模型
Monroe: A Molecular Foundation Model for In-Context Probabilistic Inference
摘要
生物测定活性预测通常受到数据限制,因为药物发现数据集依赖于耗时且昂贵的湿实验室实验来进行数据生成和评估。这一挑战激发了最近对分子基础模型(MFM)的研究,该模型旨在将通用化学知识编码为分子表示,以便在数据受限的场景中很好地推广。本文介绍了 Monroe,一种新的 MFM,与现有技术相比具有多项创新:扩大规模,允许 预训练 处理 PM6 量子化学数据集中超过 8100 万个分子;改进立体化学的图形表示;改进了训练损失,包括一致去噪和嵌入去相关;改善多任务学习;以及使用先验数据拟合模型(TabPFN)进行下游上下文预测。我们的评估使用原则性的成对比较框架来衡量统计上显着的绩效差异。在既定的 Polaris 基准中,Monroe 匹配或超过了现有的 MFM,而在旨在评估分子发现效用的活动悬崖基准上,它比以前的方法实现了显着改进。最后,消融和转移实验表明,基于 PFN 的下游预测器还大大改进了两个领先的现有模型 MiniMol 和 CheMeleon,产生了我们称为 MiniMol_PFN 和 CheMeleon_PFN 的新的最先进变体,这表明我们的下游适应策略可以推广到 Monroe 之外。源代码位于 github.com/blazejba/monroe。