论文

SAVER:选择性审核口头证据以恢复 VLM 变更推理中的错误

SAVER: Selective Auditing of Verbal Evidence for Error Recovery in VLM Change Reasoning

模型推理推理验证与自校正

摘要

视觉语言模型(VLM)在视觉变化推理方面经常失败,即使它们的视觉编码器包含足够的信息。我们观察到,正确的 VLM 输出往往包含支持所声称的更改的明确的口头证据(对象名称、颜色、空间位置),而错误的输出通常缺乏此类证据。我们提出了 SAVER(错误恢复口头证据的选择性审核),这是一种轻量级的、基于规则的方法,可以解析该证据的 VLM 响应,并仅在证据丢失或不一致时触发结构化重新提示。在三个变更检测基准和四个 VLM 中,SAVER 显着提高了因模型未能阐明其所见内容(表达失败)而导致错误的任务的准确性,在 CLEVR-Change 上的增益高达 +25.8%。证据模式也可以由 LLM 在一次调用中生成,与 CLEVR-Change 上手动调整的门相匹配。消融实验证实,证据门,而不是单独的重新提示,推动了改进。