DoublesEval:通过专业双打羽毛球诊断视觉语言模型中的多智能体战术推理
DoublesEval: Diagnosing Multi-Agent Tactical Reasoning in Vision-Language Models via Professional Doubles Badminton
摘要
视觉语言模型 (VLM) 擅长描述可见场景内容,但难以推理动态多智能体交互,其中动作语义依赖于协调的角色和时空依赖性。我们将这种能力形式化为\textbf{多代理战术推理},并引入\textbf{DoublesEval},这是一种诊断评估框架,利用专业双打羽毛球作为结构上易于处理的测试平台。 DoublesEval 采用基于关键时刻的协议,将集会分解为战术上突出的时刻,并在四个可解释的维度上探索模型:原子识别、段内复合理解、跨段因果推理和高级战术抽象。这种设计隔离了推理失败的地方,而不是仅仅测量答案的正确性。为了解决观察到的故障模式,我们提出了 \textbf{TacticCheck},这是一种轻量级约束引导的测试时一致性检查器,它使用模型自己的底层战术预测对候选答案进行重新排序,在推理时不需要参数更新或 真值 标签。通过零样本协议在 60 个策划集会上评估四个具有代表性的开源 VLM(产生 $\sim$9.6K 结构化实例),我们发现模型在所有诊断级别上仍然很弱,在空间状态、交互绑定和终端证据方面的瓶颈特别明显。 TacticCheck 在所有评估的模型中提供了一致的收益,但在稳健的战术推理方面仍然存在很大差距。这些结果凸显了下一代 VLM 对结构化、交互感知评估范例的需求。源代码可在 \href{https://github.com/Chengjt1999/DoublesEval}{\textcolor{blue}{我们的 GitHub 存储库}} 中找到。