论文

用于生成具有目标氨基酸组成的蛋白质序列的两阶段 微调

Two-Stage Fine-Tuning for Protein Sequence Generation with Targeted Amino-Acid Composition

模型训练强化学习

摘要

蛋白质语言模型是生物序列生成的标准先验,但将其引导至明确的分布设计目标在很大程度上仍未得到探索。我们研究了一个受限的蛋白质生成问题,其中序列必须与所需的氨基酸 (AA) 组成谱相匹配,同时保留合理的序列统计数据和多样性。令人兴奋的应用是合成饲料蛋白设计,其中膳食蛋白的 AA 组成直接决定其营养价值。我们提出了一个两阶段的流程,其中在域内蛋白质数据集上进行域自适应 微调 (FT),然后通过强化学习 (RL) 进行迭代奖励加权 FT,该 FT 模型锚定为冻结参考。我们评估了两种 AA 组合的流程,发现 FT 使平均组合接近目标,而后续的 RL 则强制执行仅 FT 无法满足的特定序列约束。我们还根据两个基线和一个消融变体评估了所提出的组合奖励项的设计选择,隔离每个训练阶段的贡献,并验证在不降低序列质量的情况下实现了 AA 组合比对。