论文

通过小型视觉语言模型多任务学习实现有视觉依据的胃肠内镜问答

Towards Grounded GI Endoscopy VQA via Multi-Task Learning on Small VLMs

模型训练监督微调与指令调优

摘要

胃肠 (GI) 内窥镜图像分析已从单标签分类转向视觉问答 (VQA),其中模型必须回答有关图像的自由形式的临床问题。虽然最近的视觉语言模型 (VLM) 在这项任务上取得了有希望的答案准确性,但临床采用还需要模型的内部表示来反映其答案背后的视觉证据。我们提出了一个简单的多任务 微调 配方,它从现有的 VQA 数据集构建辅助基础和描述任务,并具有最少的附加注释:直接重用专家注释的息肉掩模,而具有 Grad-CAM 本地化的 GI 域预训练分类器为查找缺少 真值 掩模的类别提供弱监督。三个小型 VLM 主干在 Kvasir-VQA-x1 上匹配的仅 VQA 和多任务配方下通过低秩自适应进行微调,并且我们在分布内和分布外数据上进行评估,显示出一致的精度增益以及答案标记和相关图像区域之间改进的隐式对齐。