论文
STSG-VQA:来自外科时空场景图的循证时间问答
STSG-VQA: Evidence-Grounded Temporal Question Answering from Surgical Spatio-Temporal Scene Graphs
摘要
尽管外科视觉语言模型(VLM)最近取得了进展,但时间推理仍然有限,因为现有的监督很大程度上是以框架为中心的。帧级场景图(SG)已被证明可以有效地提供手术环境的结构化表示,但没有明确地模拟手术工作流程的动态。为了明确模拟手术状态如何随时间演变,我们引入了一种多级结构化时间监督方法,该方法通过对象级连续性、事件级交互连续性和程序级连接来增强帧级手术 SG。然后,我们对生成的时空场景图 (STSG) 执行时间查询,以生成基于证据的问答对,它们共同构成 STSG-VQA 基准。每个问题都与时间间隔和用于得出参考答案的 STSG 证据相关联,从而实现可追溯的验证。该基准包含 7 个时间类别的 18,458 个问答对。 微调 Qwen3-VL-4B 和 Hulu-Med-4B 与 STSG 派生的监督相比,问题级微观准确率分别比零样本基线提高了 24.39 和 19.56 个百分点,比静态场景图监督提高了 16.50 和 14.25 个百分点。这些增益跨越所有时间类别,表明 STSG 衍生的监督有助于外科 VLM 对基于时间的交互而不是孤立的帧进行推理。代码和数据集将在接受后公开发布。