论文
AtelierEval:对人类与LLM作为文生图提示者的智能体化评估
AtelierEval: Agentic Evaluation of Humans & LLMs as Text-to-Image Prompters
摘要
文生图(T2I)系统日益依赖上游提示者——无论是人类还是多模态大语言模型(MLLM)——将用户意图转译为详细提示。然而现有基准固定提示、只评估T2I模型,这一上游组件的提示功力完全未被度量。我们提出AtelierEval,首个在360个专家设计任务上量化提示功力的统一基准。该基准立足于认知视角,横跨三类任务,用现实挑战分类学实例化任务,并为人类与MLLM提供双接口。为实现可扩展且可靠的评估,我们提出AtelierJudge,一个基于技能、带记忆增强的智能体评估器。它为“提示-图像”对产出主观与客观分数,与人类专家的Spearman相关达0.79,接近人类水平。大量实验将8个MLLM与48名人类用户在4个T2I后端上进行对比,验证了AtelierEval作为稳健诊断工具的价值,并揭示“模仿”优于“规划”,倡导未来提示者朝图像增强方向发展。我们的工作已发布以支持后续研究。
