论文

检查和:使用大型视觉语言模型进行手术安全的结构化推理

Sum-of-Checks: Structured Reasoning for Surgical Safety with Large Vision-Language Models

模型推理推理策略与问题分解

摘要

目的:准确评估腹腔镜胆囊切除术期间的安全批判性观点 (CVS) 对于预防胆管损伤至关重要,胆管损伤是一种与显着发病率和死亡率相关的并发症。虽然大型视觉语言模型 (LVLM) 提供灵活的推理,但它们的预测仍然难以审核,并且在安全关键型手术任务中也不可靠。方法:我们引入了 Sum-of-Checks,这是一个框架,它将每个 CVS 标准分解为专家定义的推理检查,反映临床相关的视觉证据。给定腹腔镜框架,LVLM 评估每项检查,产生二元判断和论证。标准级分数是通过检查结果的固定加权聚合来计算的。我们使用三个前沿 LVLM 对 Endoscapes2023 基准进行评估,与直接提示、思维链和子问题分解进行比较,每个都有或没有少量示例。结果:相对于所有三个模型和标准的最佳基线,检查总和将平均帧级平均精度提高了 12--14%。对个别检查的分析表明,LVLM 在观察检查(例如可见性、工具阻碍)方面是可靠的,但在决策关键解剖证据方面显示出很大的可变性。结论:将手术推理构建为专家一致的验证检查可以提高基于 LVLM 的 CVS 评估的准确性和透明度,这表明明确地将证据获取与决策分开对于可靠且可审计的手术 AI 系统至关重要。代码可在 https://github.com/BrachioLab/SumOfChecks 获取。