论文
SWoMo:白内障手术模拟的神经符号世界模型
SWoMo: Neuro-Symbolic World Model for Cataract Surgery Simulation
摘要
真实的手术模拟在训练新手外科医生和开发自主代理方面发挥着至关重要的作用。世界模型可以通过根据当前观察和手术行动预测未来患者状态,将此类模拟环境扩展到现实和多样化的程序。然而,当前最先进的方法往往无法满足临床适用性所需的关键标准,包括视觉真实感、物理基础交互以及模拟训练分布之外的场景的能力。因此,我们引入了 SWoMo,一种用于白内障手术模拟的神经符号世界模型,它将运动生成与视觉现实主义分离。符号组件由基于规则的模拟器和场景图表示组成,对运动动力学和工具组织相互作用进行建模,而扩散模型则产生逼真的视觉外观,包括纹理和组织变形。我们提出了一种反向配对策略,在模拟器中重建真实手术视频以获得配对的模拟视频和真实视频,然后将其用于训练我们的视频扩散模型,以实现模拟到真实翻译的反向目标。我们的实验表明,与之前的工作相比,定性和定量都有所改进。我们证明我们的模拟器进一步满足关键标准,包括泛化到看不见的交互几何形状、下游相位检测的改进以及无监督视频风格传输。代码、数据和模型权重可在以下网址获取:https://sharvienkumar.github.io/SWoMo/