论文
BioMatrix:迈向涵盖序列、结构和语言模态矩阵的综合生物基础模型
BioMatrix: Towards a Comprehensive Biological Foundation Model Spanning the Modality Matrix of Sequences, Structures, and Language
摘要
我们推出了 BioMatrix,这是第一个多模态基础模型,它将分子和蛋白质的序列、结构和自然语言原生集成在单个解码器架构中。现有的生物基础模型分别追求原生多模态和广泛的实体覆盖:那些在共同目标下融合多种模态的模型仍然局限于单一实体类型,而那些跨越多个实体类型的模型要么省略显式结构建模,要么依赖基于适配器的设计,在这种设计中,模型无法原生生成它可以读取的模态。 BioMatrix 通过统一的标记化方案将分子序列(支持 SMILES 和 SELFIES 符号)、分子结构、蛋白质序列、蛋白质结构和自然语言映射到共享的离散标记空间中,从而缩小了这一差距,以便在单个下一个标记预测目标下统一消耗和生成所有模态 - 无需外部编码器、投影适配器或特定模态的输出头。 BioMatrix 以 Qwen3 语言模型(1.7B 和 4B)为基础,持续对 3044 亿个标记进行预训练,这些标记涵盖一般和特定领域的文本、分子和蛋白质的序列和结构视图,以及将生物分子实体与科学文本交织在一起的跨模式语料库,并通过分子-蛋白质和蛋白质-蛋白质相互作用数据链接不同的实体。在对涵盖 6 个类别的 80 个任务的下游应用程序进行全面调整后(包括跨模态和模态内的单实体和多实体理解和生成任务),BioMatrix 在 80 项任务中的 77 项上实现了最先进的或有竞争力的性能,这表明单一的、原生的多模态通才模型可以有效地匹配或超越跨广泛生物任务的专门方法。