论文
评估评估者:诊断大型多模态模型以进行人工智能生成的图像评估
Evaluating the Evaluators: Diagnosing Large Multimodal Models for AI-Generated Image Assessment
摘要
随着文本到图像(T2I)生成的快速发展,稳健的评估变得至关重要但具有挑战性,因为传统指标无法捕获细粒度的对齐和生成工件。虽然大型多模态模型 (LMM) 越来越多地被采用作为评估器,但现有基准通常单独研究语义理解、质量感知和真实性识别,而在很大程度上忽略了责任检测。这在统一和全面的验证方面留下了空白。为了弥补这一差距,我们引入了 SQUARE-Bench,这是一个综合基准,可以从语义、质量、真实性和责任四个方面系统地评估 LMM 作为人工智能生成图像评估器的能力。 SQUARE-Bench 引入了 38 个子维度的细粒度分类法,以评估从 22 个不同模型(从传统生成器到最先进的生成器)采样的近 10K 个 AI 生成图像,并辅以超过 3K 真实世界图像。这些图像用精选的问答对进行注释。对 23 个 LMM 进行的广泛实验表明,Gemini-3-Pro 等顶级专有模型的性能已经超越了人类专家的基线。然而,模型之间的性能差距仍然很大,在细粒度推理和特定领域的鲁棒性方面表现出显着差异。除了基准测试之外,我们还对 LMM 引导的迭代编辑进行了概念验证研究,其中特定维度的 LMM 向固定图像编辑器提供诊断反馈。由此产生的引导系统在语义、真实性和责任方面产生了选择性的改进,同时表现出一致的视觉质量权衡。 SQUARE-Bench 既可以用作表征 LMM 评估器能力的诊断工具,也可以研究其在 T2I 生成细化中的使用。基准和数据集将在发布后发布。