论文
从人类的角度理解:交互式自我中心医学图像分割的多智能体系统
Understanding From Human Perspective: A Multi-agent System for Interactive Egocentric Medical Image Segmentation
摘要
交互式自我中心医学图像分割(IEMIS)在智能眼镜辅助医学图像审查中发挥着重要作用,它可以从临床医生以自我为中心的角度分割所指的医疗目标。一旦成功,它提供的对象级视觉证据将加强审查并支撑细粒度分析和临床决策。然而,指导和视频都来自用户以自我为中心的视角,这带来了两个挑战。 (1)语义模糊使得模型无法确认用户预期的目标。 (2)视觉可变性使得分割在帧之间跳跃。在本文中,我们提出了 EgoMed-Agent,这是一种多代理系统,可以通过两个工作流程从人类的角度理解目标。 (1)\textit{目标确认工作流程}将指令与候选目标进行可靠性评分,当目标定位可靠时确认目标,当目标定位不可靠时要求用户澄清,从而确认分割目标。 (2) \textit{本地化引导传播工作流程}将掩码传播与每帧目标定位结合起来,每当两者出现分歧时,使用本地化目标来校正传播的掩码,因此分段始终保持在以自我为中心的视频中的目标上。大量实验表明,EgoMed-Agent 的平均 Dice 达到 71.34\%,远高于最佳文本提示基线 (11.70\%)。我们的代码可在 \href{https://github.com/wdyyyyyy/EgoMed-Agent}{我们的项目页面}获取。