论文

注定要永远重新注释:ImageNet 的故事

Doomed to Re-Annotate, Forever: The ImageNet Story

模型评测基准与评测资源

摘要

ImageNet-1k 上的 Top-1 准确率仍然是视觉识别中最常报告的指标。数据集的质量问题已被多次报道,但仍主要使用 2012 年原始的噪声标签。本文提出了全面的努力,远远超出了之前的校正尝试,以获得准确和完整的 ImageNet-1k 验证集注释。结果,ReImageNet,包括多标签校正、对象定位、修订的类定义和语义属性(文本识别、再现、反射、人群、主导)。重新注释显示,大约 12% 的原始 ImageNet-1k 标签不正确,33.3% 的图像是多标签,3.8% 的图像不包含 ImageNet-1k 类中的对象。使用新标签,监督模型的 top-1 准确率提高了 1.2%,MLLM 的准确率提高了 5-6%。我们认为 ImageNet 规模的注释实际上不可能一次性完成,因为只有通过注释才能发现错误和定义问题,并且我们围绕重复的细化和错误检查构建管道。我们观察到,人类和 LLM 与适当工具的协作代表了当前这种规模注释的质量上限。 ImageNet-1k 问题传播到其派生测试集,表明该问题是结构性的,而不是特定于任何单个基准测试的。所有注释、类定义、指南和分析代码均已公开发布。项目页面:https://vrg.fel.cvut.cz/reimagenet 注释:https://huggingface.co/datasets/vrg-prague/ReImageNet 代码:https://github.com/klarajanouskova/ImageNet