论文

将患者教育重新思考为多轮多模态交互

Rethinking Patient Education as Multi-turn Multi-modal Interaction

智能体系统Agent任务评测

摘要

大多数医学多模态基准聚焦于图像问答、报告生成和通俗语言改写等静态任务。患者教育的要求更高:系统必须跨图像识别相关证据、指示患者看哪里、用通俗易懂的语言解释发现,并应对困惑或焦虑情绪。然而,尽管图文结合的解释可能更有助于理解,大多数患者教育工作仍仅使用文本。我们提出MedImageEdu,一个面向多轮、有证据支撑的放射科患者教育基准。每个案例提供一份包含报告文本和案例图像的放射学报告。一个DoctorAgent与一个PatientAgent进行交互,PatientAgent以一个隐藏画像为条件,该画像刻画了教育水平、健康素养和人格等因素。当患者问题可从视觉辅助中受益时,DoctorAgent可以基于报告、案例图像和当前问题,向基准提供的绘图工具下达绘图指令。工具返回图像后,DoctorAgent生成由图像和有依据的通俗语言解释组成的最终多模态回复。MedImageEdu包含来自三个来源的150个案例,从问诊(Consultation)、安全与范围(Safety and Scope)、语言质量(Language Quality)、绘图质量(Drawing Quality)和图文回复质量(Image-Text Response Quality)五个维度同时评估问诊过程与最终多模态回复。在代表性的开源与闭源视觉语言模型智能体上,我们发现三个一致的差距:流畅的语言常常超前于忠实的视觉锚定;安全在所有疾病类别中都是最弱的维度;情绪紧张的互动比低教育水平或低健康素养更难应对。MedImageEdu提供了一个受控测试床,用于评估多模态智能体能否基于证据开展教学,而非仅仅根据文本作答。

将患者教育重新思考为多轮多模态交互:论文配图
图 1:MedImageEdu 示例案例。该模型必须识别相关的视觉证据,向患者展示该看哪里,并用简单的语言进行解释,将患者教育从纯文本答案生成转变为基于图像的解释。