论文
MedVR:通过代理强化学习进行无注释医学视觉推理
MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning
摘要
医学视觉语言模型 (VLM) 为复杂的临床任务带来了巨大的希望,但它们的推理能力往往受到纯文本范式的限制,而这些范式无法根据视觉证据进行推理。这种限制不仅会降低需要细粒度视觉分析的任务的性能,还会在安全关键型应用中引入视幻觉的风险。因此,我们推出了 MedVR,这是一种新颖的强化学习框架,可为医学 VLM 提供无注释的视觉推理。其核心创新在于两个协同机制:熵引导的视觉重新定位(EVR)利用模型不确定性来指导探索,而基于共识的贡献分配(CCA)则从采样轨迹间的一致性中提炼出伪监督。 MedVR 在没有任何中间步骤的人工注释的情况下,在各种公共医疗 VQA 基准上实现了最先进的性能,显着优于现有模型。通过学习直接利用视觉证据进行推理,MedVR 提高了加速医疗人工智能临床部署所必需的稳健性和透明度。