论文
ReasonCVS:以解剖图和子条件验证组织手术场景推理
Structured Reasoning Agentic Framework for Interpretable Critical View of Safety Assessment
摘要
手术场景理解对于计算机辅助干预至关重要,但腹腔镜胆囊切除术仍然面临肝囊三角复杂解剖结构和胆管损伤风险的挑战。现有的安全关键视图 (CVS) 评估方法通常将其视为整体预测任务,将视觉特征直接映射到标准级别标签。这种黑盒范式缺乏对解剖关系的明确推理,限制了可解释性和组合概括。为了解决这个问题,我们提出了 ReasonCVS,这是一种由视觉语言模型(VLM)支持的Agentic 结构化推理框架,可将 CVS 评估分解为明确的、细粒度的解剖验证。具体来说,我们设计了一种解剖场景图抽象(ASGA),它将解剖实体及其空间关系组织成结构化表示。为了实现这一点,我们引入了一个基本原理感知推理代理,该代理由通过基本原理蒸馏进行微调的大型语言模型(LLM)提供支持。作为严格的中央决策者,它调用 VLM 驱动的子标准验证器作为专门的感知工具来解析图形并独立评估各个子标准。通过校准的软推理,该代理综合了工具收集的分布式观察结果,得出最终结论以及可追溯的临床原理。 Endoscapes-CVS201 基准的大量实验表明,ReasonCVS 实现了优于最先进技术的性能 (68.1\% mAP),同时为可靠的手术评估提供可解释的标准级解释。
