论文

FPCO-Dialog:视觉语言模型校正与合作的多轮错误前提基准

FPCO-Dialog: A Multi-Turn False-Premise Benchmark for Correction and Cooperation in Vision-Language Models

模型评测基准与评测资源

摘要

视觉语言模型(VLM)越来越多地部署在多轮设置中,用户可能会用错误的假设来描述视觉内容。然而,现有的评估很少孤立当相同的基于视觉的错误前提在对话轮次中持续存在时模型如何反应。我们引入了 FPCO-Dialog,这是一个评估 VLM 在重复错误前提下的纠正和合作行为的基准。 FPCO-Dialog 包含 1,080 个图像和 10,800 个问题轮次,按视觉复杂性、对象类别和错误前提类进行分层,并使用 10 轮协议,其中正确的对话前缀后面跟着重复的错误前提引用表达式。我们使用与模型无关的协议和 CorrTP@K 来评估 20 个商业和开源 VLM,CorrTP@K 是一种针对错误前提转向的校正率指标,由两个独立的检测器进行评分。 FPCO-Dialog 揭示了基准替代分布下的总体修正趋势、模型特定的转向动态以及错误前提类型之间的系统变化方面存在实质性且持续的跨模型差异。数据集、评估协议、模型输出、检测器标签和代码均可用。