论文

GenPuzzle:图像生成模型中视觉推理的基准测试

GenPuzzle: Benchmarking Visual Reasoning in Image Generation Models

模型评测基准与评测资源

摘要

最近的图像生成系统越来越多地将多模态理解、推理和合成结合起来,这表明它们的作用可能不仅仅是渲染合理的场景。然而,现有的评估强调美观、及时对齐、组合性或基于文本的答案,不清楚这些系统是否可以解决视觉问题并忠实地以像素表达解决方案。我们推出 GenPuzzle,这是一个以推理为中心的图像生成基准。 GenPuzzle 包含 12 个轨道的 2,005 个问题,涵盖模式完成、空间构造、迷宫、数独、非图、七巧板、棋盘游戏、火柴谜题、正交投影和数学视觉证明。每个任务都提供一个视觉谜题,并需要一个图像输出,该图像输出在执行逻辑上有效的解决方案时保留输入状态。 GenPuzzle 使用特定于任务的评估协议:离散网格输出以编程方式转录和验证,而视觉上复杂的输出则使用分层、多维或二进制多模态 大语言模型 (MLLM) 规则进行评估。我们通过测量与人类参考分数的一致性来进一步选择自动判断。在三个前沿生成器中,最强的模型仅达到 40.57 宏观总体,揭示了逻辑、几何、状态保存和指令执行方面的频繁失败。 GenPuzzle 提供了一个测试平台,用于衡量从图像渲染到视觉问题解决的进度。