论文
引导蛋白质语言模型中的流形外崩溃
Off-Manifold Collapse in Guided Protein Language Models
摘要
蛋白质语言模型广泛用于蛋白质序列设计的先验,并且越来越多的工作在推理时控制它们作为 微调 的替代方案。这样的指导面临着一个困境:足够温和以保留自然激活统计数据,但它几乎不会改变财产;强大到足以移动它,一代又一代变得越来越难以折叠。我们证明了失败有一个特定的、廉价的可检测特征,即模型自身表示的流形外崩溃。引导激活落在统计上与随机氨基酸输入无法区分的区域,并且序列退化为低复杂性,但正在优化的属性预言机仍然可以将这些世代视为成功。因此,经过优化的预言机可能无法见证崩溃,并且为了解决问题,可以积极奖励它,而结构和组成则暴露了失败。因为失败在完成的候选中已经可见,所以我们在输出中检测它而不是修改生成器。我们在天然蛋白质激活之前引入了廉价的密度,并仅保留在其下保持典型的候选者,这是一个 无需训练 事后步骤,我们称之为马哈拉诺比斯过滤。在匹配的引导设置下,它以可忽略不计的成本提高了序列的属性得分和结构合理性,而无需接触发生器,并且可以跨不同的引导方法进行传输。我们在 https://huggingface.co/Shuibai12138/off-manifold-collapse-plm 上发布了激活统计数据