论文

Open Evaluation Agent:视觉生成模型的高效可提示词定制评估

Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models

模型评测评测方法与指标

摘要

视觉生成模型的最新进展实现了高质量图像和视频生成,但评估这些模型通常需要采样成百上千张图像或视频,计算成本高昂。现有评估方法还依赖僵化的流水线,忽视用户的具体需求,且只给出数值结果而缺乏清晰解释。模仿人类仅凭少量样本即可快速形成对模型能力印象的方式,我们提出Evaluation Agent框架,采用类人策略进行高效、动态、多轮评估,并提供详细、贴合用户需求的分析。给定自然语言评估请求,该智能体将其分解为子方面、生成针对性提示词、从被评估模型采样图像或视频、调用合适的评估工具,并根据观察到的证据迭代更新计划,同时覆盖预定义基准维度和开放式用户关切。因此该框架高效、可提示词定制、可解释,并能跨模型和工具扩展。实验表明,Evaluation Agent将评估时间降至传统方法的10%,同时结果相当。我们进一步提出Open Evaluation Agent(Open-EA):构建EA-CoT-10K语料库——源自多轮评估rollout的、以历史为条件的步骤级指令微调记录——并从Qwen2.5-3B-Instruct训练出EA-3B作为本地规划骨干,在保留API版智能体的结构化推理、工具调用和总结协议的同时,减少对专有骨干的依赖。实验在成熟的T2I/T2V基准和开放式查询上验证了API版智能体,并在四个域内和三个域外T2V生成器家族上评估Open-EA,显示出所学策略的部分跨家族迁移能力。

Open Evaluation Agent:视觉生成模型的高效可提示词定制评估:论文配图
图1:评估智能体框架概览。上方的rollout流水线包含提议阶段(由Plan Agent分解用户请求、PromptGen Agent准备评估提示)和执行阶段(对视觉输出进行采样并由选定的工具进行评估)。这些阶段构成一个动态的、以用户为条件的评估迭代观察循环。下方的训练流水线将完成的rollout转化为逐步监督。子方面、思考、工具调用、观察和最终总结被组织为EA-CoT-10K,并用于将基础模型微调为EA-3B,使Open-EA能够凭借紧凑的本地规划骨干遵循相同的评估协议。