论文

表征引导的上下文学习:用多模态大语言模型解读医学影像

Representation-guided in-context learning for medical image interpretation with multimodal large language models

上下文与知识检索增强

摘要

医学影像解读对诊断和诊疗至关重要,但适配通用多模态大语言模型(MLLM)往往需要资源密集的领域微调。我们提出表征引导上下文学习(RG-ICL),一个免训练的推理框架,利用冻结编码器检索与查询对齐的示例,无需任务特定参数更新。在横跨组织病理学、放射学和视网膜眼底影像的八个数据集上,RG-ICL 相比无上下文和常规 ICL 将分类平均提升 20 个百分点、视觉问答(VQA)平均提升 13 个百分点,接近或超过基于训练的对照方法。检索了哪些病例比检索多少更关键:6 个查询对齐病例优于最多 32 个随机选择的病例,而固定或随机选择的病例常使准确率降到基线以下。对 VQA,让参考病例同时与图像内容和问题意图对齐带来进一步提升。这些发现表明,对医学影像解读而言,为 MLLM 策展其看到的参考病例,是重新训练模型的实用替代方案。