论文

ComplexityWorld:可验证视觉决策的视觉语言模型基准测试

ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making

模型评测基准与评测资源

摘要

视觉语言模型(VLM)在视觉感知方面取得了快速进展,并且越来越多地支持依赖于图像的现实世界任务。然而,许多此类任务需要的不仅仅是识别图像包含的内容:模型必须使用视觉证据来做出完整的决策,其各部分共同满足全局约束。我们推出了 COMPLEXITYWORLD,这是涵盖 39 个受领域启发的视觉世界和 29 个决策类别的 390 项任务的基准。每个任务都是从隐藏的结构化规范生成的,呈现为视觉场景,并由接受任何可行解决方案的可执行验证器进行评分。在直接推理下,除 GPT-5.6-Sol 之外的所有评估模型均低于 40% 验证者接受率(VAR),而 GPT-5.6-Sol 达到 75.6%。当相同的决策信息以结构化形式明确表达时,性能会显着提高,但在等效的视觉呈现中差异很大。代理支架提供较小的、依赖于模型的增益。总之,这些结果揭示了一个持续存在的视觉决策瓶颈,仅靠额外的推理并不能消除该瓶颈。