论文
AMIGO:Agentic 多图像目标辨识 Oracle 基准测试
AMIGO: Agentic Multi-Image Grounding Oracle Benchmark
摘要
代理视觉语言模型越来越多地通过扩展交互来发挥作用,但大多数评估仍然集中在单图像、单回合的正确性上。我们引入了 \textbf{AMIGO} (\textbf{A}gentic \textbf{M}ulti-\textbf{I}mage \textbf{G}rounding \textbf{O}racle Benchmark),这是一个在视觉上相似的图像库上识别 \emph{hidden-target} 的长期基准。在 AMIGO 中,预言机私下选择目标图像,模型必须通过在严格的协议下询问一系列以属性为中心的是/否问题来恢复它,该协议返回是/否/不确定反馈,并使用 \emph{Skip} 惩罚无效操作。这种设置强调(i)不确定性下的问题选择,(ii)跨回合的一致约束跟踪,以及(iii)随着证据积累的细粒度区分。我们使用 \textit{Guess My Preferred Dress} 任务实例化 AMIGO,并使用涵盖识别成功、证据验证、效率、协议合规性、受控反馈扰动的鲁棒性和轨迹级诊断的指标来评估开源 VLM。基准测试结果表明,仅最终答案的准确性就夸大了基于证据的性能:模型可以在没有通过验证的证据的情况下正确猜测,通过无效问题浪费资源,或者无法保留上传协议。强大的 AMIGO 性能取决于视觉辨别、信息丰富的问题选择、约束跟踪、有效停止、持续的协议遵循以及从受控反馈噪声中恢复的组合;模型规模本身并不能保证可靠的长程交互目标辨识。