论文

OphEdit:无需训练 眼科手术视频的文本引导编辑

OphEdit: Training-Free Text-Guided Editing of Ophthalmic Surgical Videos

应用与实践内容创作

摘要

高保真手术视频生成可以极大地改善医疗训练和人工智能的发展,适应这些生成模型进行精确的视频编辑仍然是一个艰巨的挑战。由于严格的解剖学和时间限制,修改手术属性(例如器械组织相互作用或手术阶段)具有挑战性。在本文中,我们提出了 OphEdit,这是一种新颖的 无需训练 框架,用于眼科手术视频的文本引导编辑。我们的方法利用确定性二阶 ODE 反演管道从原始视频中捕获注意力值 (V) 张量。通过在去噪阶段有选择地将这些存储的张量注入到条件无分类器指导 (CFG) 分支中,OphEdit 严格保留了眼睛复杂的解剖几何形状,同时将文本驱动的语义修改无缝映射到视频流上。临床评估表明,与自然域视频编辑器相比,OphEdit 能够有效处理复杂的手术转换,例如器械交换和程序变化,具有卓越的结构保真度和时间一致性。我们的工作代表了 无需训练 视频编辑在眼科手术领域的首次应用,提供了一种可扩展的解决方案,用于生成多样化的带注释的医疗数据集,而无需详尽的手动记录或昂贵的模型 微调。代码和提示可以在 https://github.com/ophedit/OphEdit 访问