论文
面向跨学科科学研究的统一多模态理解与生成模型
A unified multimodal understanding and generation model for cross-disciplinary scientific research
摘要
当今,科学发现日益依赖跨学科整合异构的高维数据。尽管AI模型已在多个科学领域取得显著成功,但它们通常仍局限于特定领域,或缺乏同时理解与生成多模态科学数据的能力,尤其对高维数据而言。然而,许多紧迫的全球挑战与科学问题本质上是跨学科的,需要在多个领域协同推进。本文提出FuXi-Uni,一个原生统一的多模态模型,可在单一架构内实现跨科学领域的科学理解与高保真生成。具体而言,FuXi-Uni将跨学科科学token对齐到自然语言token之中,并采用科学解码器来重建科学token,从而同时支持自然语言对话与科学数值预测。我们在地球科学与生物医学领域验证FuXi-Uni。在地球系统建模中,该模型仅凭语言指令即可支持全球天气预报、热带气旋(TC)预报编辑与空间降尺度。FuXi-Uni生成0.25°分辨率的10天全球预报,性能优于SOTA物理预报系统。在TC路径与强度预测上,它相对SOTA物理模型均表现更优,并生成超越标准插值基线的高分辨率区域天气场。在生物医学方面,FuXi-Uni在多个生物医学视觉问答基准上超越领先的多模态大语言模型。通过在原生共享潜空间中统一异构的科学模态并保持强大的领域特定性能,FuXi-Uni朝着更通用的多模态科学模型迈进一步。
