论文

Canopy:用于代谢工程的异构图基础模型

Canopy: A Heterograph Foundation Model for Metabolic Engineering

模型训练预训练

摘要

设计能以商业可行产物浓度生产高价值化学品的微生物菌株,是代谢工程的重要挑战。传统化学计量约束模型无法从实验数据学习,手工特征的表格机器学习又丢失生物知识关系结构。Canopy将十个公开和专有数据源整合为包含690万节点的知识图谱,覆盖13种节点类型、34种边类型,以及基因、蛋白质、代谢物、反应、通路、菌株和发酵实验。节点特征分别用ESM-2编码蛋白序列、MoLFormer编码化学SMILES、PubMedBERT编码生物医学文本,形成单图中的多模态表示。异构图Transformer结合SignNet位置编码、Jumping Knowledge聚合与虚拟节点,以链接预测、掩码节点建模、距离预测和实验对比聚类四项自监督目标预训练,并用可学习的同方差不确定性权重平衡。在发酵产物浓度预测任务上,冻结Canopy嵌入结合轻量探测器取得R²=0.41,优于最佳R²=0.24的表格基线及同构GNN变体。