论文

更少的细节,更好的答案:VQA 的降级驱动提示

Less Detail, Better Answers: Degradation-Driven Prompting for VQA

上下文与知识上下文工程

摘要

视觉语言模型 (VLM) 的最新进展显着突破了视觉问答 (VQA) 的界限。然而,高分辨率细节有时会变成噪音,导致幻觉或推理错误。在本文中,我们提出了退化驱动提示(DDP),这是一种新颖的框架,它通过策略性地降低图像保真度来迫使模型专注于基本的结构信息,从而提高 VQA 性能。我们通过两项不同的任务来评估 DDP。物理属性针对容易被人类误判的图像,其中 DDP 采用 80p 下采样、结构视觉辅助(白色背景掩模和正交线)和上下文学习 (ICL) 的组合来校准模型的焦点。感知现象解决了各种机器敏感的视觉异常和错觉,包括视觉异常 (VA)、颜色 (CI)、运动 (MI)、格式塔 (GI)、几何 (GSI) 和视觉错觉 (VI)。 对于此任务,DDP 将任务分类阶段与专用工具(例如模糊蒙版和对比度增强以及下采样)集成在一起。我们的实验结果表明,少即是多:通过有意降低视觉输入并提供有针对性的结构提示,DDP 使 VLM 能够绕过分散注意力的纹理,并在具有挑战性的视觉基准上实现卓越的推理准确性。