论文

ViGoR-Bench:视觉生成模型距离零样本视觉推理机还有多远?

ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?

模型评测基准与评测资源

摘要

现代 AIGC 模型令人惊叹的视觉保真度背后隐藏着一个“逻辑沙漠”,系统无法完成需要物理、因果或复杂空间推理的任务。当前的评估很大程度上依赖于肤浅的指标或零散的基准,造成了忽视生成过程的“绩效幻象”。为了解决这个问题,我们引入了 ViGoR Vision-G(以生成推理为中心的基准),这是一个旨在消除这种幻象的统一框架。 ViGoR 通过四项关键创新脱颖而出:1)桥接图像到图像和视频任务的整体跨模式覆盖; 2)中间过程和最终结果双轨评价机制; 3)基于证据的自动法官确保高度的人类一致性; 4) 粒度诊断分析,将性能分解为细粒度的认知维度。对 20 多个领先模型的实验表明,即使是最先进的系统也存在严重的推理缺陷,将 ViGoR 确立为下一代智能视觉模型的关键“压力测试”。该演示已在 https://vincenthancoder.github.io/ViGoR-Bench/ 上提供