论文

提示优化器是盲目的吗?面向自动提示优化的跨模态视觉反馈

Are Prompt Optimizers Blind? Cross-Modal Visual Feedback for Automatic Prompt Optimization

上下文与知识上下文工程

摘要

自动提示优化(Automatic Prompt Optimization, APO)已被广泛用于在不更新权重的情况下将视觉—语言模型(VLM)适配到下游任务,并取得可喜成果。然而在多模态任务上,APO的效果受制于一个根本性的盲反馈通道:优化器只读问题、预测与标准答案,却从不看模型失败的输入图像,因此无法诊断视觉定位类错误。作为补救,我们提出跨模态视觉反馈(Cross-Modal Visual Feedback, CMVF)。CMVF包含(1)失败条件化的视觉诊断阶段,由更强的优化器VLM在不接触预测或标签的情况下检查每个失败图像;(2)错误感知聚合阶段,将这些观察压缩为可复用的任务级视觉盲区模式,用于驱动提示改写。关键的是,图像只在优化期间被使用;部署产物是一个普通文本提示,其推理成本与任何纯文本基线相同。在12个VQA数据集与4个目标VLM上的广泛结果表明,CMVF始终排名第一,在每个目标模型上平均比最强基线高2.4分,个别基准上最高提升6.5分。此外,优化器自发组织出专家式的视觉检查清单,可在不重新优化的情况下跨模型迁移。

提示优化器是盲目的吗?面向自动提示优化的跨模态视觉反馈:论文配图
图 1:CMVF 的动机。现有的纯文本 APO 可以看到分数和错误三倍,但错过了失败的视觉原因。 CMVF 仅在优化期间使用失败的图像来将视觉盲点聚合到可重复使用的文本提示中,在测试时没有额外的视觉反馈调用。