论文

S1-Omni:面向科学理解、预测与生成的统一多模态推理模型

S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation

模型训练预训练

摘要

我们提出S1-Omni,一个面向科学理解、预测与生成的统一多模态推理模型。AI for Science(AI4S)已通过领域专用模型、工具增强LLM与科学语言模型取得长足进展,但模型能力仍然高度割裂,限制了异构数据、科学定律与专家知识的联合建模。S1-Omni把这些能力整合进单一、连贯的科学推理模型。其架构建立在三个核心组件上:科学数据的统一表示、自然世界知识对齐、以及面向领域任务的解码。第一,S1-Omni把自然语言指令与科学对象——包括CIF、SMILES、蛋白质序列、光谱与科学图像——映射到共享表示空间。第二,它把科学定律与专家知识纳入数据构建与训练,使模型能从科学证据出发推理。第三,它执行任务特定解码,支持性质预测、光谱到分子生成、蛋白质位点与结构预测、科学图像生成与编辑等广泛应用。S1-Omni在覆盖200个科学任务、含数百万推理样本的S1-Omni-Corpus上训练,并在60多个科学基准上评估:在多数基准上优于GPT-5.5与Gemini-3.1-Pro,并在若干基准上达到或超越领域专用模型。总体而言,S1-Omni为统一科学建模提供了一条可行路径。

S1-Omni:面向科学理解、预测与生成的统一多模态推理模型:论文配图
图 1:S1-Omni 的统一架构。文本、CIF、SMILES、蛋白质、光谱和科学图像首先由共享视觉语言模型处理。然后,其隐藏表示通过文本、标量、位置索引、坐标和图像解码器转换为自然语言响应、属性预测、位点预测、三维结构和科学图像生成或编辑结果。