论文

MedClaw:用于长视野手术视频推理的启发式代理工具

MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning

智能体系统Agent HarnessAgent Skills

摘要

理解数十分钟的手术视频需要长视野时间推理,通过跨时间传播的视觉证据来回答手术之前、之后或跨阶段发生的情况。现有方法处理这一问题效果不佳:一次性视觉语言模型(VLM)压缩整个过程以适应其上下文窗口,并丢失“之前”或“之后”问题所依赖的细节,而训练模型看向何处的视频代理需要大量数据,并且很难转移到域外手术。我们构建了一个代理工具,将推理与感知分开,并通过发展上下文而不是优化权重来改进。纯文本编排器计划收集哪些证据并发出可审核的工具调用序列,而冻结的视觉语言子代理则在像素上执行每个调用,查看、裁剪、检查帧并检索外部知识。我们进一步提出了一种无梯度、奖励门控的启发式技能 蒸馏 循环,该循环挖掘代理自己的低分痕迹,并仅在提高验证奖励时保留候选技能,从而产生可重用的检索技能,特别是定向重新查看。该循环通过扩展外部技能库而不是调整权重,只适应大约 100 个标记示例,远少于监督或强化 微调 所需的数量。为了评估这个代理,我们引入了 MedClawBench,这是一个基于医生的、未泄露的基准,包含 1,123 个问题,涉及自建的长神经外科录音和公开讲座视频测试部分。在这两个数据集和所有四个评估维度上,我们的代理始终优于一次性 VLM 和通用视频代理框架,在较长的域外神经外科视频上收益最大。项目页面:https://fyycs.github.io/medclaw/。