论文
UltraWorld:从无动作标注临床视频学习超声世界模型
UltraWorld: Learning Interactive Ultrasound World Models from Untracked Clinical Videos with Acoustic Sampling Map
摘要
世界模型可以通过根据局部观察预测探头运动的结果来实现自主超声扫描。学习这种动作-观察关系通常依赖于同步视频-姿势对,大规模收集这些视频-姿势对的成本很高,并且在常规临床记录中基本上无法获得。接下来的可靠行动还需要对超声波的横截面采样几何形状进行建模。我们推出了 UltraWorld,一种自蒸馏配方,可将临床超声视频中的先验转移到交互式世界模型中,而无需实际动作注释。从临床视频开始,我们将视频基础模型改编成以参考图像和解剖掩模为条件的超声发生器。通过 3D 解剖学沿着可编程轨迹采样的解剖掩模为合成动作视频对提供空间指导。然后,我们使用这些合成对将生成器自提炼成一个世界模型,该模型根据局部观察和动作预测未来的观察结果,而无需在推理时使用解剖掩模或其他 3D 资产。到 为了进一步改进动作跟踪,我们引入了声学采样图 (AsMap),它将探头姿势和成像设置表示为像素级 3D 采样位置、波束方向和深度。实验证明了预测保真度和行动跟踪的改进。在九个模拟闭环局部规划事件中,与视觉伺服相比,UltraWorld 将到目标的平均最终距离和方向误差分别减少了 29% 和 38%。项目页面:https://ultraworld-project.github.io/。
