论文
大型发现模型:基于经验的模型的开放式搜索
Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search
摘要
科学发现通常涉及在巨大的、结构化的、开放式的假设空间(例如分子、蛋白质序列和计算机程序)上优化评估成本高昂的目标。 大语言模型 (LLM) 等生成模型提供了此类空间的表达先验,但它们的可能性和自我评估对于目标和校准的认知不确定性来说是不可靠的代理,特别是对于观察到的数据分布之外的新候选者。我们引入了大型发现模型(LDM),这是一种基于经验的循环架构,它将生成模型与贝叶斯非参数奖励代理模型结合起来。生成模型提出并完善候选设计,而代理预测其性能并量化不确定性,从而产生指导候选生成、细化和选择的不确定性感知值。随着每个新实验观察的到来,发现记忆和替代模型不断更新。我们在跨越不同设计模式和目标的三种场景中评估 LDM,包括神经网络训练、抗体设计和分子优化。与跨这些域的仅 LLM 反射或传统统计搜索相比,LDM 在验证 BPB 方面实现了 $2.4\times$ 的大幅降低,结合能相对降低 $18.2\%$,以及分子多目标性能的相对增益超过 $60\%$。这些结果表明,LDM 可以作为通用发现引擎,用于在开放式假设空间上进行有效搜索。