论文
用于高效搜索按需定制库的领域适应分子语言模型
Domain-Adapted Molecular Language Models for Efficient Search of Make-on-Demand Libraries
摘要
预训练的分子语言模型越来越多地用作学习结构-性质关系的分子编码器。然而,它们在预训练领域内外进行分子发现的实际适用性仍不清楚。在这里,我们系统地对跨越药物发现、有机材料和催化的六个虚拟分子库中的四种分子语言模型进行了基准测试。原生分子语言模型嵌入显示出跨库的发现性能存在显着差异,而分子指纹提供了一致的强健基线。与潜在的域表示不匹配一致,我们表明显式域适应可以显着提高表示性能。目标虚拟库中的结构上的 微调 分子语言模型编码器持续提高了样本效率,多个经过调整的编码器在基准任务中成为表现最佳的表示形式。这些结果表明,分子表示质量在很大程度上取决于目标域,并且显式适应可以提高分子基础模型的实用性。更广泛地说,我们的研究结果将域适应分子表示确立为虚拟筛选和自动驾驶实验室中样本高效自适应决策的一种有前景的策略。