论文

表格上下文学习器可以推广到生物分子特性预测吗?

Can Tabular In-Context Learners Generalize to Biomolecular Property Prediction?

模型评测模型能力评测

摘要

从有限的标记数据预测生物分子特性是蛋白质工程和小分子设计的中心瓶颈。由于强大的预训练编码器现在提供丰富的固定长度表示,因此困难已经从表示学习转移到为少样本机制构建数据高效的预测器。 TabPFN 和 TabICL 等表格基础模型不太可能胜任这一角色:它们是在从随机因果图绘制的合成表上进行预训练的上下文学习者,这是一种与生成蛋白质序列或分子图的过程没有明显对应的生成先验。这种表格形式的因果归纳偏差应该转移到生物分子数据上,这是违反直觉的,但我们发现确实如此。将每种方法视为预测变量-表示对,我们跨两个领域进行评估。我们发现,在蛋白质适应度回归任务中,这些上下文学习模型与 ESM Cambrian 表示相结合,在 ProteinGym 上达到或超过了最先进的结果,并且在不同的酯酶催化活性数据集上优于特定任务的监督回归器。对于使用 ECFP/RDKit 描述符的小分子分类,在 TDC ADMET、MoleculeNet、FS-Mol 和 DrugOOD 中,没有单一的预测器-表示配对占主导地位,但它们与现有的特定任务最先进技术具有竞争力。至关重要的是,在蛋白质和小分子几次任务中,这些预测器-表示对都提供了强大的性能。我们得出的结论是,表格基础模型可以成为强大的生物分子预测因子,但前提是与表达性表示相结合。