论文

KamonBench:用于评估视觉语言模型中的成分恢复的基于语法的数据集

KamonBench: A Grammar-Based Dataset for Evaluating Compositional Factor Recovery in Vision-Language Models

模型评测基准与评测资源

摘要

家徽(家族徽章)是日本文化的重要组成部分,也是构图视觉识别的自然测试案例:每个徽章都结合了少量的象征选择,但可能的描述空间很少。我们推出 KamonBench,这是一个基于语法的图像到结构基准测试,包含 20,000 个合成复合波峰和辅助组件示例。每个复合波峰都配有正式的家花描述语言 - “kamon yōgo” - 描述、分段日语分析、英语翻译和非语言程序代码。由于每个合成波峰都是根据已知因素(即容器、修饰符和主题)生成的,因此 KamonBench 支持超出字幕级别准确性的评估:直接程序代码因子度量、受控因子对重组分割、固定容器修饰符上下文下的反事实主题敏感组以及因子可访问性的线性探针。我们包括 ViT 编码器/Transformer 解码器和两个 VGG n-gram 解码器的基线结果,有或没有学习的位置掩码。因此,KamonBench 为视觉语言模型中的稀疏组合视觉识别和因子恢复提供了一个受控测试平台。