论文

FRIGID:在训练和推理时根据质谱缩放基于扩散的分子生成

FRIGID: Scaling Diffusion-Based Molecular Generation from Mass Spectra at Training and Inference Time

模型推理测试时计算扩展

摘要

串联质谱在识别未知小分子的科学发现工作流程中发挥着重要作用,但高通量结构解析仍然具有挑战性。虽然最近的自回归和图扩散模型在从头阐明方面显示出了希望,但在训练和推理期间,性能仍然受到可扩展性较差的限制。在这项工作中,我们提出了 FRIGID,这是一个具有新颖扩散语言模型的框架,该模型通过中间指纹表示和确定的化学式生成以质谱为条件的分子结构,并在数亿个未标记结构的规模上进行训练。然后,我们演示前向碎片模型如何通过识别频谱不一致的碎片并通过有针对性的重新掩码和去噪来细化它们来实现推理时间缩放。虽然 FRIGID 已经凭借其扩散基础实现了强大的性能,但推理时间缩放显着提高了其准确性,在具有挑战性的 MassSpecGym 基准上超过了 18% 的 Top-1 准确性,并且是 NPLIB1 上领先方法的 Top-1 准确性的三倍。进一步的实证分析表明,FRIGID 随着推理时间计算的增加而表现出对数线性性能扩展,为从头结构阐明的持续改进开辟了一个有希望的新方向。 FRIGID 代码可在 https://github.com/coleygroup/FRIGID 上公开获取。