论文
显微视觉语言模型中高效快速选择的人机交互框架
A Human-in-the-Loop Framework for Efficient Prompt Selection in Microscopy Vision-Language Models
摘要
用于显微镜图像分类的深度学习管道通常需要昂贵、劳动和时间密集的专家注释来生成高质量的 真值 进行训练。最近的工作表明,视觉语言模型 (VLM) 的即时调整可以通过构建一个经过专家验证的图像标题示例的小型提示集来减少手动注释,该示例集可重用为少样本上下文,以在推理时对所有剩余图像进行分类。为了进一步减少工作量,VLM 可以为候选范例起草标题,然后专家对其进行验证并进行轻微编辑,而不是从头编写文本。然而,有两个实际问题仍未解决:(1)应优先考虑哪些未标记图像进行验证,以及(2)需要多少经过验证的样本才能达到性能目标。在这项工作中,我们通过将提示集构建制定为目标驱动的主动学习问题来解决这些问题,该问题优先考虑要注释的图像。我们在严格的低资源限制下和小型未标记池中研究了三个互补的选择标准。实验表明,我们的方法用比随机选择少得多的专家验证图像就达到了目标性能,平均只需 20 张带注释的图像即可实现 100% 的测试准确率。更广泛地说,我们的人机循环框架展示了在生物医学图像分析中以人为中心的生成式人工智能的使用,其中专家仍然积极参与验证和完善模型输出,同时显着降低注释成本。代码和数据将公开。