论文
PFArena:面向蛋白质修饰的语言模型基准
PFArena: Benchmarking Language Models for Protein Modification
摘要
蛋白质修饰需要在一个巨大的序列空间中导航,而湿实验验证通量低且成本高。尽管蛋白质语言模型(PLM)、大语言模型(LLM)与基于LLM的Agent等计算范式在蛋白质修饰上展现出前景,它们在现实实验决策场景中的相对成效仍不清楚。为弥合这一缺口,我们提出PFArena,一个包含四个受控任务接口的基准,覆盖单突变体生成与多突变体排序。通过提供不同水平的突变适应度数据,PFArena反映了以既有实验上下文程度不同为特征的四种代表性研究场景。我们使用互补的指标评估六个PLM、六个LLM与五个基于LLM的Agent,衡量峰值与整体蛋白质修饰性能。我们的评测显示,模型性能随目标特异性实验证据的可用性系统性变化:PLM凭借蛋白质特异性先验在开放式单突变体生成上表现出色,而LLM与Agent在多突变体排序上表现强劲,尤其是在有目标特异性适应度数据可用时。尽管如此,随着搜索空间规模与突变深度的增加,所有模型家族都面临根本性挑战。我们发布代码与基准套件,以促进模型辅助蛋白质修饰的可复现研究。
