论文
ReXSonoVQA:以程序为中心的超声理解的视频 QA 基准
ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding
摘要
超声采集需要熟练的探头操作和实时调整。视觉语言模型(VLM)可以实现自主超声系统,但现有基准仅评估静态图像,而不评估动态程序理解。我们推出了 ReXSonoVQA,这是一个视频 QA 基准,包含 514 个视频剪辑和 514 个问题(249 个 MCQ,265 个自由回答),针对三种能力:行动目标推理、工件解析和优化以及程序上下文和规划。对 Gemini 3 Pro、Qwen3.5-397B、LLaVA-Video-72B 和 Seed 2.0 Pro 的零样本评估表明,VLM 可以提取一些程序信息,但解决问题仍然具有挑战性,与纯文本基线相比,收益最小,暴露了因果推理的局限性。 ReXSonoVQA 能够开发用于超声训练、引导和机器人自动化的感知系统。