论文

RealBirdID:MLLM 时代鸟类物种识别的基准测试

RealBirdID: Benchmarking Bird Species Identification in the Era of MLLMs

模型评测基准与评测资源

摘要

野外的细粒度鸟类物种识别通常无法从单个图像中得到答案:关键线索可能是非视觉的(例如发声),或者由于遮挡、相机角度或低分辨率而模糊。然而,今天的多式联运系统通常是根据可回答的、模式内的案例来判断的,鼓励自信的猜测而不是原则上的弃权。我们提出了 RealBirdID 基准:给定一张鸟的图像,系统应该要么回答一个物种,要么回答一个具体的、基于证据的理由:“需要发声”、“低质量图像”或“视野受阻”。对于每个属,数据集都包含一个验证分割,该验证分割由带有标记理由的精选无法回答的示例组成,并与一组明确可回答的实例配对。我们发现(1)可回答集上的物种识别对于各种开源和专有模型来说具有挑战性(包括 GPT-5 和 Gemini-2.5 Pro 在内的 MLLM 的准确率低于 13%),(2)具有更大分类能力的模型不一定经过更多校准来避免无法回答的示例,以及(3)即使他们确实放弃,MLLM 通常也无法提供正确的理由。 RealBirdID 为弃权意识细粒度识别建立了一个重点目标,并制定了衡量进展的方法。