论文

FineGen:基于 VLM 的细粒度图像文本数据集构建多代理框架

FineGen: A VLM-based Multi-Agent Framework for Fine-Grained Image-Text Dataset Construction

模型训练合成数据

摘要

当前视觉语言数据集中硬负样本的稀缺极大地阻碍了细粒度的感知。为了解决这个问题,我们提出了 FineGen,一个基于 VLM 的多代理框架,用于自动数据集构建。通过采用具有闭环反馈机制的协作生成-验证-校正管道,FineGen 确保合成的硬底片在语义上有效,但与视觉内容严格矛盾。将其应用于 ImageNet,我们构建了 FineGen-100K,这是一个分层数据集,包含超过 147,000 个特定于属性的硬负例,具有严格的 1:10 正负比。广泛的评估确认属性有效性为 96.7%。至关重要的是,FG-OVD 基准的下游验证表明,FineGen-100K 上的 微调 在硬样本上的准确率大幅提高了 14.4%,显着优于最先进的方法。