论文

仔细观察,然后诊断:通过主动缩放进行置信度超声 VQA

Look-Closer-Then-Diagnose: Confidence-Aware Ultrasound VQA via Active Zooming

模型训练强化学习

摘要

视觉语言模型 (VLM) 具有显着先进的医学视觉问答功能,但其在超声方面的性能仍然不够理想。在临床实践中,超声检查医师明确关注病变区域来制定报告,尽管诊断解释有时由于固有的主观性而有所不同。然而,现有的 VLM 并没有明确的结构来在诊断之前交互式地放大病变;此外,他们通常将注释视为公正的基本事实,而没有考虑到其固有的主观性和模糊性。在本文中,我们提出了一个专门设计用于考虑超声检查医师的认知工作流程的框架。我们首先引入结构化的缩放然后诊断范例,它复制交互式搜索过程以实现以病变为中心的推理。此外,在组相对策略优化(GRPO)框架内,我们引入了一种源自随机分组采样轨迹的不确定性奖励,以估计预测一致性作为模型置信度的代理。这两个组成部分共同鼓励模型加强对明确案例的准确预测,同时在模糊情况下保持谨慎。肝脏、乳房和甲状腺数据集的实验表明,我们的框架将病变定位提高了 39.3%,这表明我们的模型已经学会了主动观察和诊断的能力。