论文

MIMIC:面向生物分子的生成式多模态基础模型

MIMIC: A Generative Multimodal Foundation Model for Biomolecules

模型架构新型架构

摘要

生物功能源于序列、结构、调控、进化与细胞环境之间相互耦合的约束,然而生物学中的大多数基础模型仅在单一模态内或针对固定的前向任务进行训练。我们提出 MIMIC——一个生成式多模态基础模型,它在我们新构建并对齐的数据集 LORE 上训练,该数据集在部分可观测的生物分子状态内关联了核酸、蛋白质、进化、结构、调控以及语义/情境模态。MIMIC 采用分轨编码器-解码器架构,能够以观测模态的任意子集为条件,在基因组、转录组和蛋白质组范围内重建或生成分子状态的缺失组成部分。与仅用序列输入相比,多模态条件化持续提升 MIMIC 的序列重建效果,同时其学习到的表示在 RNA 与蛋白质下游任务上达到最先进水平。MIMIC 实现了最先进的剪接预测,其联合生成式建模支持异构体感知(isoform-aware)推理,进一步提升性能。超越预测之外,同一生成式框架还支持受约束的设计。在 RNA 层面,MIMIC 利用进化与结构信号,在不回复临床相关的 HBB 剪接破坏突变本身的情况下识别出纠正性编辑。在蛋白质层面,以 PD-L1 与 hACE2 结合位点的形状和表面化学性质进行联合条件化,生成了多样化、高置信度的序列,并在计算机模拟中获得了对靶标结合的强有力支持。最后,MIMIC 将实验情境用作语义条件来建模依赖实验方法的 RNA 化学探测,而不是把情境当作固定的输出。综上所述,这些结果使 MIMIC 的对齐多模态生成建模成为在单一模型内统一表示学习、条件预测与受约束生物分子设计的坚实基础。

MIMIC:面向生物分子的生成式多模态基础模型:论文配图
图 1:MIMIC 框架概述。 (A) 分子生物学数据具有高度异质性,涵盖基因组、转录组和蛋白质组序列,每个序列都有多种分析和测量来描述其功能。 (B) 我们策划了 LORE,一个多模态数据集,它将来自多个存储库的数据集成并对齐到一组统一但部分观察到的训练示例中。 (C) 利用这些数据,我们构建了 MIMIC,这是一种异质分子生物学的多模态基础模型。 MIMIC 使用分轨编码器-解码器架构对这些示例进行建模,该架构结合了共同对齐的轨内信号,同时保留了不同的语义输入。 (D) MIMIC 能够实现多模态表示学习、高度准确的属性和剪接预测以及整个分子生物学的约束生成设计。