论文
单目腹腔镜视频 无需训练 代理推理的 4D 表示
A 4D Representation for Training-Free Agentic Reasoning from Monocular Laparoscopic Video
摘要
时空推理是软组织手术中人工智能 (AI) 的一项基本能力,为智能辅助系统和自主机器人技术铺平了道路。虽然 2D 视觉语言模型在理解手术视频方面显示出越来越大的前景,但手术场景的空间复杂性表明推理系统可能会受益于显式 4D 表示。在这里,我们提出了一个框架,为外科手术人员配备基于显式 4D 表示的时空工具,使 AI 系统能够在时间和 3D 空间中进行自然语言推理。利用点跟踪、深度和分割模型,我们开发了一个具有时空一致工具和组织语义的连贯 4D 模型。然后,多模态 大语言模型 (MLLM) 充当从显式 4D 表示(例如轨迹)派生的工具上的代理,而无需任何 微调。我们在包含 134 个临床相关问题的新数据集上评估我们的方法,发现通用推理主干和我们的 4D 表示的结合显着提高了时空理解并允许 4D 基础。我们证明,时空智能可以从 2D MLLM 和 3D 计算机视觉模型“组装”出来,无需额外训练。代码、数据和示例可在 https://tum-ai.github.io/surg4d/ 获取