论文
S1-Omni-Image:科学图像理解、生成和编辑的统一模型
S1-Omni-Image: A Unified Model for Scientific Image Understanding, Generation, and Editing
摘要
我们推出了 S1-Omni-Image,这是一种用于科学图像理解、生成和编辑的开放权重统一多模态模型。与通用图像生成模型不同,科学图像任务不仅需要高保真合成,还需要对科学语义、结构关系、领域知识和任务意图的深入理解。为此,S1-Omni-Image建立在科学多模态推理主干S1-VL-32B的基础上,并将其理解能力与统一的生成前思考范式下的图像生成模块结合起来。给定用户指令,模型首先生成面向任务的推理轨迹、文本答案和任务特殊标记;然后将它们的隐藏状态注入生成模块以调节图像生成或编辑。 S1-Omni-Image支持在统一框架中进行科学的图像理解、生成和编辑。在生成方面,它侧重于科学插图和文本渲染,包括逻辑图、关系比较、数据图表和逼真的科学可视化。对于编辑,它将分割和其他特定领域的视觉任务转化为本地图像编辑问题,从而实现多轮插图编辑、医学和地理图像分割、医学图像翻译和科学图像超分辨率。我们构建了 SciGenEdit,一个 314K 样本的训练数据集,并发布了模型权重、推理代码和 SciGenEdit-10K。实验表明,S1-Omni-Image 极大地改进了科学图像的生成和编辑,同时保留了从 S1-VL-32B 继承的科学图像理解能力。它在 GenExam 和 TechImage-Bench 上优于开源模型,在 MSD、cigRockSEM、SynthRAD2025 和 IXI 等四个编辑基准上取得了最先进的结果,并在科学图像理解评估上保持稳定的性能。