论文
观察、符号化、行动:用空间表征为VLM提供依据对齐以改进游戏表现
See, Symbolize, Act: Grounding VLMs with Spatial Representations for Better Gameplay
摘要
视觉语言模型(VLM)擅长描述视觉场景,却难以将感知转化为精确、有依据的行动。我们研究同时为VLM提供视觉画面和场景的符号化表征能否提升其在交互环境中的表现。我们在Atari游戏、VizDoom和AI2-THOR上评估三个最先进的VLM,比较仅画面、画面加自提取符号、画面加真值符号以及仅符号四种流水线。结果表明,当符号信息准确时,所有模型都受益。然而,当VLM自行提取符号时,表现变得依赖于模型能力和场景复杂度。我们进一步研究了VLM从视觉输入中提取符号信息的准确程度,以及这些符号中的噪声如何影响决策和游戏表现。我们的发现揭示,只有当符号提取可靠时,符号与视觉对应才对VLM有益,并凸显感知质量是未来基于VLM的智能体的核心瓶颈。
