论文

视频模型的视觉提示工程

Visual prompt engineering for video models

上下文与知识上下文工程

摘要

在基础模型时代,模型的好坏取决于它的提示。因此,即时工程已成为提高语言模型性能的重要技术。由于视频模型目前正在成为视觉任务(例如视觉推理)的基础模型,因此我们在这里询问它们是否同样受益于视觉提示工程:自动修改任务图像以提高模型性能。例如,对于视觉物理推理任务(“经过一组障碍物后,球落在哪里?”),只需调用图像编辑模型即可将抽象的草图式场景转换为逼真的版本。我们发现视觉提示工程(简称 VIPE)可以提高跨任务的视频推理性能。事实上,对于视频模型,视觉提示工程甚至比经典的基于文本的提示工程或测试时间缩放更有效。最终,正如基于文本的提示工程系统地提高了语言模型性能一样,视觉提示工程可以作为一种简单、计算高效的方法,从视频模型中获得更好的视觉推理性能。我们的项目页面上的示例视频位于 https://visual-prompt-engineering.github.io/。