论文
不断提示:评估 VLM 中重复的苏格拉底式提示
Just Keep Prompting: Evaluating Repetitive Socratic Prompting in VLMs
摘要
在现实环境中部署视觉语言模型(VLM)不仅需要强大的视觉推理能力,还需要在持续的对话压力下保持稳定性。我们引入了 Just Keep Prompting (JKP),这是一种多轮评估框架,当用户反复质疑、质疑或反驳模型的答案时,该框架可衡量 VLM 认知稳定性。 JKP 使用三种策略探测模型最多 10 个后续回合:对抗性否定(反复拒绝)、纯粹苏格拉底式审问(反复要求重新评估确定性)和情境感知苏格拉底式总结(在要求重新考虑之前反映模型先前的基本原理)。我们在 720 次多轮运行的 STAR 基准子集上评估了 GPT-4o、Gemini 2.5 Pro 和 Qwen3-VL-30B。从第 0 圈到第 10 圈,总准确度略有变化,但轨迹级分析揭示了很大的不稳定性:正确答案回归,错误答案恢复,并且许多运行表现出重复的答案翻转。重复的提示有一定的好处,并且常常起到破坏稳定的作用,而不是推理的辅助手段。效果强烈依赖于模型:Qwen3-VL-30B 实现了最高的最终精度,但在直接矛盾的情况下变得自信错误; Gemini 2.5 Pro相对稳定但词元昂贵; GPT-4o 是最脆、最易振荡的。这些发现表明,多轮 VLM 评估不仅捕获了额外的推理,还捕获了压力响应曲线:模型如何在反复挑战下权衡视觉证据依据、校准和对话合规性。