论文

TC3-VQA:结合临床条令的急救视觉问答基准

A doctrine-grounded visual question answering dataset for Tactical Combat Casualty Care

模型评测基准与评测资源

摘要

战术战伤救治 (TC3) 要求响应人员将对伤害和干预措施的目视观察与既定的临床指导联系起来。开发视觉语言模型来支持这一过程需要监督,将可见证据与可追溯的条令联系起来。我们提出了 TC3-VQA,这是一个由公共教学和现场 TC3 视频以及权威 TC3 文档构建的数据集。它包含涵盖 11 个概念的 581 个项目,1,860 个问题,涵盖干预识别、条令、临床推理、程序指导以及视觉信息不足时的拒绝。基于条令的答案保留逐字来源段落和字符偏移。构建结合了视觉标注、段落检索、蕴涵检查和跨模型系列的验证。装备边界框、解剖标签、时间段和源元数据伴随着问答对。由两名医生和两名医学生进行的自动审核和评级表征了标注质量,并可对 88 个保留项目进行人工评级。该数据集提供了使视觉语言模型适应 TC3、研究视觉证据与临床知识之间的联系以及评估识别、条令 召回率 和拒答的资源。

TC3-VQA:结合临床条令的急救视觉问答基准:论文原图
图 2:TC3-VQA 构建工作流程。左:从图像直接生成问题和答案。右:视觉概念分配、学说检索、逐字答案锚定和蕴涵过滤。设备和解剖注释记录视觉证据;跨家庭审查和认可共识检查概念标签。拒绝问题针对框架中缺少的信息。