学习用于自回归生成的潜在蛋白质语言
Learning Latent Protein Languages for Autoregressive Generation
摘要
自回归变压器对于蛋白质序列和结构生成仍然相对较弱。我们研究目标表示的作用:氨基酸 token 编码残基身份,没有明确的上下文语义,而 骨干模型 坐标需要我们框架中的离散表示。我们介绍两种学习的潜在蛋白质语言。蛋白质潜在语言 (PLL) 将序列映射到基于冷冻 ESM-2 编码器构建的 4,096 状态上下文字母表,每个残基有一个 token。结构潜在语言 (SLL) 采用辅助序列和置信度监督的 GCP-VQVAE Lite,同时保留对 骨干模型 坐标的解码。我们使用 next-token 预测分别在 PLL 和 SLL token 上预训练自回归变压器模型,产生 PLLM 和 SLLM。在匹配的下游序列训练下,PLLM 的拟合计算缩放指数为 0.038,而氨基酸自回归模型的计算缩放指数为 0.020。在无条件序列生成中,相对于跨采样温度的氨基酸模型,PLLM 将低于启发式 1.5 位残基组成熵阈值的样本分数减少了 54%。对于序列到结构的预测,在匹配的训练下,用 SLL 替换原始的 GCP-VQVAE Lite 分词器可将最佳验证困惑度降低 34%。对于长蛋白质,在我们的测量中,潜在 token 采样比基于 MSA 的 AlphaFold2 大约快 1,000 倍。在骨干模型一代中,SLLM在多样性和新颖性方面与其他生成模型相比毫不逊色。我们还观察到早期迹象表明,使用 SLLM 的内部 token 置信度进行推理时采样可以提高序列到结构的预测质量,超越单个解码样本。这些结果将学习的潜在蛋白质语言定位为蛋白质生成中自回归变压器缩放和推理时采样的有前景的基质。
