论文

FindIt:通用多模态的格式通知视觉检测基准 LLM

FindIt: A Format-Informed Visual Detection Benchmark for Generalist Multimodal LLMs

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 主要在自由形式视觉语言任务上进行评估,例如视觉问答、字幕和摘要。然而,它们的实际用途正在迅速扩展到更加结构化的计算机视觉设置,用户提示模型通常在更大的代理或决策系统中执行以本地化为中心的任务,例如对象检测。尽管发生了这种转变,目前还没有标准化的基准可以系统地大规模评估这些能力。在这项工作中,我们引入了第一个综合基准,专门用于评估通才 MLLM 的即时本地化能力。我们的基准测试涵盖四个核心任务类别:对象检测、引用表达检测、实例级检测和基于视频的检测。为了实现一致和公平的评估,我们开发了一个统一的框架,该框架标准化输入,强制可解析的边界框输出,并定义跨任务的透明评估协议。使用该套件,我们评估了一组不同的开源和专有 MLLM,对其性能和局限性进行了深入分析。除了准确性之外,我们还检查了模型遵守输出格式规范的能力,表明当前系统对格式限制高度敏感,并且通常无法概括甚至微小的变化。我们的结果强调了最先进的 MLLM 在本地化环境中的优点和缺点,并为改进多模态模型设计和评估指明了重要方向。