论文

Surg-UniWorld:带多模态控制专家的统一手术世界模型

Surg-UniWorld: A Unified Surgical World Model with Multimodal Control Experts

模型架构新型架构

摘要

可控手术世界模型能够通过合成逼真的器械—组织交互,为手术人工智能与仿真提供生成式基础。然而,现有方法缺乏统一的多模态控制范式,而异构视觉条件的直接融合常常导致解剖结构失真、器械外观漂移和时间上不一致的交互。在本工作中,我们提出Surg-UniWorld,一个带多模态控制专家的统一手术世界模型。Surg-UniWorld首先由首帧外观和层级语义掩码构建分层手术锚点(Hierarchical Surgical Anchor),以保持持久的场景身份、解剖组织和交互边界。随后,锚点相对模态专家(Anchor-Relative Modality Experts)相对于共享锚点解读边缘、深度和光流证据,捕捉互补的边界、几何与运动信息。多模态控制专家(Multimodal Control Expert)进一步对被激活的模态增量执行保贡献的分级组合,并为Wan2.2视频扩散骨干生成控制提示信息。为支持多模态手术世界建模,我们进一步构建了Cholec80-SurgWAM,一个可控手术视频生成基准。大量实验表明,Surg-UniWorld在生成质量、时间一致性和多模态可控性方面持续优于现有可控视频生成方法与手术世界模型基线。

Surg-UniWorld:带多模态控制专家的统一手术世界模型:论文配图
图1:Surg-UniWorld概览,用于多模态控制的连贯器械—组织交互视频生成。该框架支持边缘、深度与光流控制的任意组合的即插即用集成。