论文

FIKA-Bench:从细粒度识别到细粒度知识获取

FIKA-Bench: From Fine-grained Recognition to Fine-Grained Knowledge Acquisition

模型评测基准与评测资源

摘要

日常生活中的细粒度识别往往不是闭门造车的分类问题:当遇到不熟悉的物体时,人类会主动搜索、比较视觉细节、核实证据,然后再做出决定。现有的基准主要评估视觉识别,而这种主动的外部知识获取能力尚未得到充分探索。我们研究细粒度知识获取,系统必须寻找、验证和使用外部证据来回答开放式细粒度识别问题。我们推出 FIKA-Bench,这是一个泄漏感知且基于证据的集合,包含 311 个公共源和现实生活实例。为了确保高质量,每个示例都根据前沿闭卷模型进行过滤,以删除记忆的案例,并进行审核以消除图像答案泄漏,仅保留经过验证的证据支持的样本。我们对最新大型多模态模型 (LMM) 和智能体的评估表明,这项任务仍然是一项艰巨的挑战:最好的系统只能达到 25.1% 的准确率,没有模型超过 30%。至关重要的是,我们发现仅仅为模型配备工具并不足以弥补这一差距。代理失败主要是由错误的实体检索和不良的视觉判断造成的。这些结果表明,可靠的知识获取需要更好的专注于细粒度识别的代理设计。