论文
通过动作驱动的数字孪生对手术室剪辑进行推理文本到视频检索
Reasoning Text-to-Video Retrieval for Operating Room Clips via Action-Driven Digital Twins
摘要
手术室 (OR) 中的文本到视频检索是一种实现手术室安全的技术,因为它允许利益相关者检索和检查特定事件的记录。然而,由于最安全的关键事件可能不遵循通用结构,因此要释放其全部潜力,文本到视频检索必须能够处理需要推理来识别正确视频的隐式查询(例如,剪辑之前的步骤)。然而,现有方法依赖于全局嵌入,无法推理此类查询。我们提出了 OR3,一种文本到视频的检索方法,可将剪辑转换为动作驱动的数字双胞胎 (ActDT),在不重叠的时间间隔下对并发的主体-动作-客体三元组进行分组。此外,OR3 不是通过配对编码器进行跨模式匹配,而是执行基于想象的检索,其中 LLM 根据查询生成假设的 ActDT。这可以通过使用 ActDT 定制的硬底片训练的单个编码器实现模态内匹配。最后,基于证据的细化根据与顶级候选者的差异修改想象的 ActDT,以捕获特定于程序的模式。我们根据 MM-OR 构建了一个基准,其中包含来自机器人膝盖程序的 386 个剪辑的四个推理类别的 276 个隐式查询。 OR3 达到 57.6 R@1 和 77.3 R@5,优于最强的基线。这些结果表明,OR3 通过时间动作推理能够对视觉上相似的 OR 视频剪辑进行细粒度区分。