将患者教育重新思考为多轮多模态交互
Rethinking Patient Education as Multi-turn Multi-modal Interaction
摘要
大多数医学多模态基准聚焦于图像问答、报告生成和通俗语言改写等静态任务。患者教育的要求更高:系统必须跨图像识别相关证据、指示患者看哪里、用通俗易懂的语言解释发现,并应对困惑或焦虑情绪。然而,尽管图文结合的解释可能更有助于理解,大多数患者教育工作仍仅使用文本。我们提出MedImageEdu,一个面向多轮、有证据支撑的放射科患者教育基准。每个案例提供一份包含报告文本和案例图像的放射学报告。一个DoctorAgent与一个PatientAgent进行交互,PatientAgent以一个隐藏画像为条件,该画像刻画了教育水平、健康素养和人格等因素。当患者问题可从视觉辅助中受益时,DoctorAgent可以基于报告、案例图像和当前问题,向基准提供的绘图工具下达绘图指令。工具返回图像后,DoctorAgent生成由图像和有依据的通俗语言解释组成的最终多模态回复。MedImageEdu包含来自三个来源的150个案例,从问诊(Consultation)、安全与范围(Safety and Scope)、语言质量(Language Quality)、绘图质量(Drawing Quality)和图文回复质量(Image-Text Response Quality)五个维度同时评估问诊过程与最终多模态回复。在代表性的开源与闭源视觉语言模型智能体上,我们发现三个一致的差距:流畅的语言常常超前于忠实的视觉锚定;安全在所有疾病类别中都是最弱的维度;情绪紧张的互动比低教育水平或低健康素养更难应对。MedImageEdu提供了一个受控测试床,用于评估多模态智能体能否基于证据开展教学,而非仅仅根据文本作答。
