论文
面向多模态LLM-as-a-Judge的双层提示优化
Bi-Level Prompt Optimization for Multimodal LLM-as-a-Judge
摘要
大语言模型(Large Language Model,LLM)已被广泛用作评估 AI 生成内容的自动化裁判。尽管取得成功,将基于 LLM 的评估与人类判断对齐仍然具有挑战性。虽然在人工标注数据上进行监督微调可以改善对齐,但其成本高且不灵活,需要针对每个任务或数据集重新训练。自动提示优化(Auto Prompt Optimization,APO)的近期进展提供了一种更高效的替代方案,可自动改进引导 LLM 裁判的指令。然而,现有 APO 方法主要针对纯文本评估,在多模态设置中仍研究不足。本工作研究多模态 LLM-as-a-Judge 的自动提示优化,尤其是对 AI 生成图像的评估。我们识别出一个关键瓶颈:受上下文窗口约束,多模态模型只能处理数量有限的视觉示例,这阻碍了有效的试错式提示改进。为克服这一瓶颈,我们提出 BLPO,一个双层提示优化框架,它将图像转换为文本表示,同时保留与评估相关的视觉线索。我们的双层优化方法联合精炼裁判提示与图像到文本(I2T)提示,在有限的上下文预算下保持保真度。在四个数据集和三个 LLM 裁判上的实验证明了我们方法的有效性。
