论文
MIRCaps:具有图像级和区域级图像描述的大规模混合域数据集,用于细粒度视觉语言学习
MIRCaps: A Large-Scale Mixed-Domain Dataset with Image-Level and Region-Level Captions for Fine-Grained Vision-Language Learning
摘要
尽管视觉语言模型(VLM)最近取得了进展,但用于通用和基于闭路电视的视频监控系统的混合域图像图像描述数据集仍然有限。为了解决这一差距,我们引入了一个大规模多模态数据集,其中包含 141,364 个图像、981,947 个图像级标题、1,742,264 个区域级标题和 1,391,779 个边界框注释。每个图像平均与描述整个场景不同方面的七个图像级标题相关联,以及每个带注释的边界框的七个区域级标题。这些互补的图像描述类型旨在帮助 VLM 学习细粒度的视觉属性,包括对象类别、估计大小、颜色、动作、状态和周围环境背景。我们展示了该数据集在两个重要下游任务上的有效性:图像图像描述和对象检测。实验结果表明,轻量级 VLM,包括 SmolVLM-256M-Instruct、BLIP、BLIP2 和 Qwen2.5-VL 3B-Instruct,可以使用我们的数据集进行有效的微调。我们的数据集和代码可在 https://zenodo.org/records/20418601 上公开获取。