论文

如何花好Oracle预算:蛋白质结构预测模型的实用指南

How to Spend Your Oracle Budget: Practical Guidance for Protein Structure Prediction Models

模型评测模型能力评测

摘要

蛋白质结构预测基础模型在某些目标上仍然不可靠。外部oracle可以标记并纠正这些失败,但生物学oracle价格昂贵,使oracle预算成为关键约束。现有指导方法,如FK-steering、DPO和Best K-of-N采样,在如何花费这一预算上各不相同,但尚无系统比较来指导方法选择。为弥合这一差距,我们对这些方法以及近期提出的Optimisation Over Outputs(O3)进行基准测试,后者在生成模型的潜子空间内应用现成的优化器。我们将O3的用法扩展到蛋白质结构预测模型。总体而言,我们的工作提供了首个oracle预算感知指导的实用参考。我们在钙调蛋白(1CLL)和大肠杆菌天冬氨酸转氨甲酰酶(9EEH)两个蛋白质目标上的评估表明,没有单一方法在所有预算和oracle下始终占优。具体而言,O3在低oracle预算下最为有效,而FK-steering和DPO随预算增加表现出更好的性能。我们将这些发现提炼为在真实oracle预算约束下工作的从业者的可操作建议。

如何花好Oracle预算:蛋白质结构预测模型的实用指南:论文配图
图1:在 Boltz-2 中通过 O3 进行贝叶斯优化。由三个钙调蛋白(Calmodulin)种子样本创建的 d=3d=3 代理子空间(上排),展示 2D 𝒰\mathcal{U} 空间(下排)、GP 训练数据(白点)与 𝒰\mathcal{U} 上的平均预测后验、两轮采集的最大采集点(红十字),以及直接评估 oracle 的 25x25 穷举真值网格(右下)。