论文

CV-Arena:利用人机协作偏好解决教学计算机视觉问题的开放基准

CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences

模型评测基准与评测资源

摘要

指令引导的图像编辑正在成为视觉工作的通用界面,但现有的基准仍然主要集中在狭隘的外观编辑上,并且没有完全捕捉专业工作流程中真实图像任务的多样性。在这里,我们将教学计算机视觉问题解决定义为图像编辑的更广泛的表述:给定真实的输入图像和自然语言指令,系统必须产生编辑的输出,实现所需的转换,同时满足显式的保存、几何、物理和可用性约束。我们推出了 CV-Arena,这是一个开放的基准测试,旨在以专业规模评估这种能力。 CV-Arena 包含 12K 高分辨率真实图像指令对,涵盖 16 种基于指令的视觉任务类型,使用 CogRetriever 构建,CogRetriever 是一种双轨检索和管理管道,结合了目标 Web 搜索、代理查询细化、验证和可追溯性。为了在保持人类保真度的同时大规模评估模型,我们提出了 Active Elo,这是一种人类与人工智能协作偏好协议,它利用 CV-Judge(一种逻辑门控、多维 VLM 评估器)来拒绝明显的失败并解决高置信度比较问题;并与专家评估者进行密切、高质量的比较。然后通过可靠性加权的 Elo 更新来聚合人类和人工智能的混合监督。我们对 CV-Arena 上的 21 个系统(包括专有、开源和代理模型)进行了全面评估,揭示了在指令依从性、物理推理、结构控制和细粒度细节保留方面持续存在的差距。我们进一步开发了 CV-Agent,一种结合了规划、编辑和验证的轻量级代理模型,并证明闭环推理是专业级指令跟踪可视化编辑的一个有前途的方向。