论文

PFArena:面向蛋白质修饰的语言模型基准

PFArena: Benchmarking Language Models for Protein Modification

模型评测基准与评测资源

摘要

蛋白质修饰需要在一个巨大的序列空间中导航,而湿实验验证通量低且成本高。尽管蛋白质语言模型(PLM)、大语言模型(LLM)与基于LLM的Agent等计算范式在蛋白质修饰上展现出前景,它们在现实实验决策场景中的相对成效仍不清楚。为弥合这一缺口,我们提出PFArena,一个包含四个受控任务接口的基准,覆盖单突变体生成与多突变体排序。通过提供不同水平的突变适应度数据,PFArena反映了以既有实验上下文程度不同为特征的四种代表性研究场景。我们使用互补的指标评估六个PLM、六个LLM与五个基于LLM的Agent,衡量峰值与整体蛋白质修饰性能。我们的评测显示,模型性能随目标特异性实验证据的可用性系统性变化:PLM凭借蛋白质特异性先验在开放式单突变体生成上表现出色,而LLM与Agent在多突变体排序上表现强劲,尤其是在有目标特异性适应度数据可用时。尽管如此,随着搜索空间规模与突变深度的增加,所有模型家族都面临根本性挑战。我们发布代码与基准套件,以促进模型辅助蛋白质修饰的可复现研究。

PFArena:面向蛋白质修饰的语言模型基准:论文配图
图 1:PFArena 四个蛋白质修改任务上的基准性能。方法类别以单元格背景色区分:蛋白质语言模型、大语言模型与智能体。在智能体中,Claude 指 Claude Opus 5,GPT 指 GPT-6 Astra。任务 T1 按 Recall@40 排名,任务 T2–T4 按 Spearman 相关系数排名。其余指标的结果详见实验部分。