论文
提示优化器是盲目的吗?面向自动提示优化的跨模态视觉反馈
Are Prompt Optimizers Blind? Cross-Modal Visual Feedback for Automatic Prompt Optimization
摘要
自动提示优化(Automatic Prompt Optimization, APO)已被广泛用于在不更新权重的情况下将视觉—语言模型(VLM)适配到下游任务,并取得可喜成果。然而在多模态任务上,APO的效果受制于一个根本性的盲反馈通道:优化器只读问题、预测与标准答案,却从不看模型失败的输入图像,因此无法诊断视觉定位类错误。作为补救,我们提出跨模态视觉反馈(Cross-Modal Visual Feedback, CMVF)。CMVF包含(1)失败条件化的视觉诊断阶段,由更强的优化器VLM在不接触预测或标签的情况下检查每个失败图像;(2)错误感知聚合阶段,将这些观察压缩为可复用的任务级视觉盲区模式,用于驱动提示改写。关键的是,图像只在优化期间被使用;部署产物是一个普通文本提示,其推理成本与任何纯文本基线相同。在12个VQA数据集与4个目标VLM上的广泛结果表明,CMVF始终排名第一,在每个目标模型上平均比最强基线高2.4分,个别基准上最高提升6.5分。此外,优化器自发组织出专家式的视觉检查清单,可在不重新优化的情况下跨模型迁移。
