论文

AffordTissue:工具-动作特定组织相互作用的密集可供性预测

AffordTissue: Dense Affordance Prediction for Tool-Action Specific Tissue Interaction

应用与实践视觉感知与空间理解

摘要

手术动作自动化在实现外科医生般的灵巧控制方面取得了迅速进展,这主要是由演示和视觉语言动作模型学习的进步推动的。虽然这些已经在桌面实验中取得了成功,但将它们转化为临床部署仍然具有挑战性:当前的方法对仪器在组织表面上的相互作用位置提供了有限的可预测性,并且缺乏明确的条件输入来强制执行特定于工具动作的安全相互作用区域。为了解决这一差距,我们引入了 AffordTissue,这是一个多模式框架,用于在胆囊切除术期间将工具动作特定组织可供性区域预测为密集热图。我们的方法结合了跨多个视点捕获工具运动和组织动力学的时间视觉编码器、能够跨不同仪器动作对进行泛化的语言调节,以及用于密集可供性预测的 DiT 式解码器。我们通过整理和注释 103 个胆囊切除手术中的 15,638 个视频剪辑,建立了第一个组织可供性基准,涵盖涉及四种器械(钩子、抓握器、剪刀、剪刀)及其相关任务的六种独特的工具动作对:解剖、抓握、修剪和切割。实验表明,相对于视觉语言模型基线(20.6 px ASSD 与 Molmo-VLM 的 60.2 px)相比,我们的任务特定架构在密集手术可供性预测方面优于大规模基础模型。通过预测工具作用的特定组织可供性区域,AffordTissue 为安全手术自动化提供了明确的空间推理,有可能解锁针对适当组织区域的明确政策指导,并在仪器偏离预测安全区时尽早安全停止。