论文
FLAIR:以潜动作注入支持稳定手术视频生成
Beyond Masks and Trajectories: Flow-Guided Latent Action Injection for Stable Surgical Video Generation
摘要
手术视频生成在手术教育、模拟和数据增强方面具有巨大潜力,但生成具有逼真且临床合理运动的手术视频仍然具有挑战性。大多数现有方法依赖辅助条件,例如掩模、轨迹、深度或参考视频,来实现视觉上合理的合成。然而,这些辅助条件通常需要额外的手动注释或专门的采集,使得这些方法很难扩展到小型、精选的数据集之外。这就激发了对无参考架构的需求,该架构能够生成高质量的手术视频,而在推理时不需要辅助视觉条件。我们提出了 FLAIR,一种用于生成无参考手术视频的流引导 LatentAction 注射框架。 FLAIR 从真实手术视频的光流中学习动作先验,根据输入提示动态预测相应的潜在动作表示,并将其注入冻结的基础模型中,以生成具有改进的动作一致性的手术视频。我们进一步 构建 SurgActionClip-30K,这是第一个大规模手术视觉数据集,包含以动作为中心的分段剪辑和结构化标题标签,解决了持续缺乏细粒度、以动作为中心的手术数据集的问题。最后,我们介绍了 SurgMetrics,这是第一个针对特定手术领域的评估指标,用于量化生成的手术视频的质量,解决了该领域长期缺乏基于临床的评估标准的问题。大量实验表明,FLAIR 能够在没有辅助条件的情况下使用纯文本推理生成高质量的手术视频,并且 SurgMetrics 中的验证表明,与传统指标相比,FLAIR 更符合人类感知。
