论文
用于手术交互识别的潜在动作引导视觉语言对比学习
Latent-Action-Guided Vision-Language Contrastive Learning for Surgical Interaction Recognition
摘要
识别器械与组织的相互作用对于情境感知外科人工智能至关重要。视觉语言模型提供了一种自然的方式,通过将视频特征与文本动作描述对齐,将语义结构注入手术表征中。然而,预训练的编码器可能缺乏空间一致性,而全局语义对齐不能确保精确的空间和时间表示。通过分析帧与帧之间的特征变化,我们发现语义对齐增加了它们的维度,但较大的增加并不一定会提高识别率;编码器在交互区域的显性变化定位程度方面也存在差异。受这些发现的启发,我们引入了 LAViFiT,它将帧到帧的变化压缩为潜在动作,并在端到端视频语言对齐期间预测下一帧特征。在没有额外的空间或运动注释的情况下,LAViFiT 改善了我们评估的设置中主要特征变化和时间方向敏感性的交互基础。我们进一步描述了动作能力和预测强度如何影响编码器和三元组组件的识别。 LAViFiT 使用图像编码器而无需进行大规模视频预训练,与 V-JEPA2/2.1 相比,LAViFiT 具有更快的推理速度和更小的 INT4 精度下降,从而实现了有竞争力的识别,从而支持了其部署潜力。