论文

黑盒视觉语言模型的测试时提示

Test-Time Hinting for Black-Box Vision-Language Models

上下文与知识上下文工程

摘要

测试时间缩放 (TTS) 方法已被证明对于 LLM 非常有效,但其在视觉语言模型 (VLM) 中的应用仍然相对未得到充分探索。现有的 VLM TTS 方法很大程度上需要开放权重模型访问或昂贵的重复采样,并且主要根据多模态数学和科学推理基准而不是一般的视觉理解任务进行评估。在本文中,我们提出了 Test-Time Hinting,这是一种通过单个 VLM 调用提高 VLM 性能的方法,并且只需要黑盒 API 访问,这使得它广泛适用于前沿封闭权重模型。我们的方法的动机是观察到 VLM 错误往往聚集在重复出现的故障模式周围。因此,我们训练一个轻量级提示生成器模型来预测,对于给定的测试输入,应该在提示之前添加哪些“提示”,提供有针对性的上下文或程序指导,引导 VLM 远离其特征故障模式。我们表明,测试时提示提高了多个闭权重 VLM 在自然图像 VQA 基准上的准确性,并且这些增益可以推广到未见过的基准和 VLM,而无需重新训练提示生成器。