论文
通过轨迹感知过程监督改进医疗 VQA
Improving Medical VQA through Trajectory-Aware Process Supervision
摘要
推理能力对于可靠的医学视觉问答(VQA)至关重要;然而,现有的数据集很少包含推理解释。我们通过使用 COMCTS 算法和开源视觉语言模型为六个医学 VQA 基准生成推理轨迹来解决这个问题,并以 LLM 作为验证法官。基于这些生成的数据集,我们提出了一个两阶段训练框架:监督 微调,然后是具有新颖的基于流程的奖励的组相对策略优化(GRPO)。虽然标准方法仅依赖于最终答案的精确匹配奖励,但我们引入了轨迹感知奖励来衡量生成的推理过程和 真值 推理过程之间的相似性。具体来说,我们使用句子 Transformer 嵌入推理步骤,并计算结果向量序列之间的动态时间规整 (DTW) 距离。六个基准测试的实验表明,将基于 DTW 的过程奖励与精确匹配奖励相结合始终优于仅 SFT 训练,将平均准确度从 0.598 提高到 0.689,将平均 BERTScore 从 0.845 提高到 0.881,将平均 ROUGE-L 从 0.665 提高到 0.748。我们的结果强调了过程监督在训练具有推理能力的医学 VLM 中的重要性。我们在 https://anonymous.4open.science/r/MICCAI-R1-MED-VQA-code-B14B/ 上公开提供我们的代码和生成的推理数据集