使用小型多模态语言模型进行伤口分类的上下文学习
In-Context Learning for Wound Classification with Small Multimodal Language Models
摘要
伤口图像分类通常被视为特定于任务的监督学习问题,需要大量手动标记数据并在标签空间或部署设置发生变化时进行重新训练。本研究评估了小型多模态语言模型 (SMLM) 是否可以通过基于检索的上下文学习 (ICL) 为伤口分类提供 无需训练 替代方案。实验使用了两个公共伤口图像数据集:Kaggle 伤口数据集(1469 个图像,10 个类别)和 Medetec 数据集(560 个图像,9 个类别)。来自 Qwen 3.5、Ministral 3 和 Gemma 4 系列的 11 个 SMLM 在带有随机支持示例的零样本提示和少样本提示、基于嵌入的 k 最近邻 (kNN) 检索和 kNN 检索以及最大边缘相关性重排序 (MMR) 下进行了评估。仅检索加权 kNN 控制、支持集缩减实验和支持上下文大小扫描用于评估检索、模型规模和提示长度的效果。查询条件 ICL 始终优于零样本提示和随机少样本提示。在Kaggle数据集上,采用kNN+MMR的Qwen 3.5 27B取得了最好的结果,达到了0.872的准确率和0.871的F1分数。在 Medetec 上,采用 kNN+MMR 的 Qwen 3.5 27B 达到了 0.678 准确率和 0.670 F1。较大的模型超出了匹配的加权 kNN 控制,这表明检索到的示例的使用超出了最近邻投票的范围。基于检索的 ICL 在支持集减少的情况下略有下降,并且大多数增益在 8-10 个支持图像时饱和。基于检索的 ICL 允许 SMLM 执行适应性伤口图像分类,而无需特定任务的再训练。紧凑的检索上下文可以支持实用且注重隐私的部署,尽管性能仍然取决于模型规模、检索策略和数据集难度。