论文

VIEScore2:具有空间基础解释的统一图像评估

VIEScore2: Unified Image Evaluation with Spatially Grounded Explanations

模型训练强化学习

摘要

现有的合成图像评估器通常仅提供标量质量分数,并且不识别支持它的图像区域。我们推出了 VIEScore2,这是一个用于图像生成和编辑任务的统一评估器,具有可选条件图像。 VIEScore2 将图像表示为 N x N 网格,并在一次模型前向计算中联合预测质量分数和缺陷位置。其文本原生网格表示为异构空间监督提供了通用接口,并实现了可直接验证的后训练目标。我们使用 38K 个示例进行训练,涵盖仅评分、仅定位以及跨生成和编辑任务的联合监督。从监督微调开始,我们进一步应用 GRPO 来使用结合单元级 Dice 重叠、得分准确性和输出格式有效性的奖励来改进缺陷定位。无参数解析器将结构化预测转换为可读的解释。在主要套件上,VIEScore2 的 总体评分的SRCC为 0.601,而 Gemini-3-Flash 的 SRCC 得分为 0.491,Gemini-3-Flash 是匹配输入下最强的零样本通用 VLM 基线。对于缺陷定位,VIEScore2 在每图像网格 IoU 的六个基准中的三个上优于通用 VLM 和专用空间评估器,并在五个上排名前三,包括超出其训练源的数据集。