你的模型已经知道不要教它,学会问它:视觉语言模型的小样本适应的软提示
Your Model Already Knows Don't Teach It, Learn to Ask It: Soft Prompting for Few-Shot Adaptation of Vision-Language Models
摘要
我们在航空、工业和医学图像等域外环境中使用视觉语言模型 (VLM) 解决少样本目标检测问题,仅使用 10 个带注释的图像进行监督。现有的适配方法有离散提示优化和LoRA 微调。我们重新审视第三种选择:软提示,其中少量连续提示标记被优化,而预训练的骨干网保持冻结。我们确定了两个关键的设计选择。首先,将提示标记放置在视觉和文本标记之间的跨模式边界处优于其他放置位置(10.0 与 8.4 mAP)。其次,从空白标记初始化提示优于语义和随机初始化。通过这些选择,一到三个学习词元(平均 7,168 个参数)与 Roboflow20-VL(14.2 mAP,10 次射击)上的最佳 LoRA 配置匹配,同时训练的参数数量减少了 20,000 倍以上。软提示仍然更难优化,随机种子之间表现出更高的方差。然而,与 LoRA 不同的是,它不会导致遗忘:与我们的准确度相匹配的 LoRA 排名使 NaturalBench VQA 准确率相对降低了 35%,在最大排名时上升至 56%,而软提示则使预训练的性能保持不变。学习到的标记的行为就像提示而不是权重。它们无需重新训练即可转移到更新的模型(Qwen3.5-9B 上 +0.8 mAP),并且可以用语言表达为与提示搜索方法竞争的可读提示(匹配 DetPO 并优于 GEPA)。该方法还超出了检测范围。在 RoboCasa 操作任务中,冻结的 $π_{0.5}$ 视觉语言动作策略受益于软提示,当词元被放置在梯度瓶颈时,与三个任务中的两个任务的 LoRA 基线相匹配。这些结果表明现代 VLM 已经编码了专业领域所需的大部分内容;挑战在于学习如何提问。