论文

EPIC-Bench:视觉语言模型中细粒度体现视觉基础的以感知为中心的基准

EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models

模型评测基准与评测资源

摘要

虽然大型视觉语言模型(VLM)越来越多地被采用作为实体代理的感知支柱,但现有的基准通常依赖于问答或多项选择格式。这些协议允许模型利用语言先验,而不是展示真正的视觉基础。为了解决这个问题,我们推出了 EPIC-Bench,即 Embodied PerceptIon BenChmark,这是一个细粒度的基准测试,旨在系统地评估 VLM 在现实世界的体现环境中的视觉感知能力。 EPIC-Bench 包含 6.6k 个经过精心注释的元组(图像、文本、掩模),跨越体现交互管道的三个核心阶段的 23 个细粒度任务:目标定位、导航和操作。对超过 89 个领先的 VLM 的广泛评估表明,虽然先进的推理模型显示出前景,但当前的 VLM 普遍难以应对物理交互中复杂的视觉文本对齐问题。具体来说,模型在多目标计数、部分整体关系理解和可供性区域检测方面表现出关键瓶颈。 EPIC-Bench 为推进下一代视觉驱动的具体模型提供了坚实的基础和可行的见解。