论文

VisionQ:计算机视觉定性分析的 VLM 作为评审分类法、数据集和基准

VisionQ: VLM-as-a-Judge Taxonomy, Dataset and Benchmark for Qualitative Analysis in Computer Vision

模型评测基准与评测资源

摘要

定性比较数据是计算机视觉论文中的核心证据,视觉语言模型(VLM)越来越多地用于判断它们。然而,现有的基准测试仅对标量质量或总体偏好进行评分,因此评判者可能会因错误的视觉原因而选择首选图像而获得奖励。我们推出了 VisionQ,这是第一个根据同行评审的简历比较数据构建的基准,它将每个判断都建立在指定的视觉标准上:每个问题都说明了标准,只有当评委根据该标准选择了作者认为最好的输出时,才会获得认可。我们将此任务称为标准条件视觉辨别。 VisionQ 包含 (1) 1,409 篇 CVPR 和 ICCV 论文的语料库,其中包含 1,800 多个经过验证的比较图和 3,911 个手动注释数据点,将方法裁剪与作者陈述的视觉主张联系起来; (2) 定性判断背后的视觉标准的六轴、51叶分类法; (3) 以标准为条件的评估协议,隐藏方法名称、标题和论文身份,并报告每个标准的准确性; (4) VisionQ-Judge,一个经过 DPO 调整的 Gemma-4-E4B 评审,在对称证据对上进行训练,在保留的测试集上将最后选项预测减少了 7.0pp,并将准确性提高了 2.5pp。通过评估 20 名开源和闭源 VLM 评审,我们发现最强者的准确率仅为 63.1%(机会为 32.2%),而且不同标准的可靠性差异很大。代码:https://github.com/ReML-AI/visionq. 数据:https://huggingface.co/datasets/visionq-anon-2026/VisionQ-1k.