论文
量化和高效适应的蛋白质语言模型的分析
Analysis of Quantized and Efficiently Adapted Protein Language Models
摘要
背景:蛋白质语言模型 (PLM) 越来越多地用于序列生成和属性预测,但其规模使得微调和部署成本高昂。量化和参数高效微调对性能、表示和生成的影响仍未得到充分表征。结果:我们评估了 ESM-2、ESMC、ProtBERT、ProtT5、Ankh、Ankh3 和 Profluence-E1 的 4 位量化和低秩适配器微调 (QLoRA)。在蛋白质预测任务中,许多模型-任务对保留了 90% 以上的完全微调性能。尽管性能和效率因模型、数据集和训练配置而异,但最大模型的峰值 GPU 内存节省接近 90%。 QLoRA 通常保留早期层表示,同时在中层和后期层引入特定于任务的适应,类似于具有较小表示变化的完全微调。训练速度和力量效果更加多样化。对于使用 ProLLaMA、ProtGPT2、ProGen2、ProteinGLM 和 ESM3 的无条件生成,4 位量化在很大程度上保留了预测的结构和序列级属性,但标记级分析揭示了自回归输出分布中与模型相关的变化。结论:QLoRA 和 4 位量化降低了 PLM 计算要求,特别是 GPU 内存使用量。我们的结果支持 QLoRA 作为内存有限适应的首过策略,为具有挑战性的任务、不稳定的架构或低验证恢复保留全面的微调。对于生成 PLM,序列级和结构指标应与分布分析相补充,因为仅下游预测可能会错过量化引起的变化。这些方法可以扩大大规模蛋白质建模的范围,同时需要特定于模型和任务的验证。