论文

观察、符号化、行动:用空间表征为VLM提供依据对齐以改进游戏表现

See, Symbolize, Act: Grounding VLMs with Spatial Representations for Better Gameplay

智能体系统Agent任务评测

摘要

视觉语言模型(VLM)擅长描述视觉场景,却难以将感知转化为精确、有依据的行动。我们研究同时为VLM提供视觉画面和场景的符号化表征能否提升其在交互环境中的表现。我们在Atari游戏、VizDoom和AI2-THOR上评估三个最先进的VLM,比较仅画面、画面加自提取符号、画面加真值符号以及仅符号四种流水线。结果表明,当符号信息准确时,所有模型都受益。然而,当VLM自行提取符号时,表现变得依赖于模型能力和场景复杂度。我们进一步研究了VLM从视觉输入中提取符号信息的准确程度,以及这些符号中的噪声如何影响决策和游戏表现。我们的发现揭示,只有当符号提取可靠时,符号与视觉对应才对VLM有益,并凸显感知质量是未来基于VLM的智能体的核心瓶颈。

观察、符号化、行动:用空间表征为VLM提供接地以改进游戏表现:论文配图
图1:帧图像与真值符号相结合的处理流程,为VLM提供空间符号表征以支撑游戏操作。