论文
所想即所见:经视觉-语言好奇心驱动VLM智能体探索
What You Think is What You See: Driving Exploration in VLM Agents via Visual-Linguistic Curiosity
摘要
为在部分可观测的视觉环境中导航,近期VLM智能体日益把世界建模能力经由显式CoT推理内化进策略,使其能在行动前心理模拟未来。但仅依赖对已访状态的被动推理不足以应对稀疏奖励任务:缺乏主动揭示「已知的未知」的认知驱力,而这对稳健泛化至关重要。我们问:VLM智能体能否通过好奇驱动探索主动寻找能挑战并精炼其内部世界模型的信号?本文提出GLANCE,一个统一框架,把智能体的语言世界模型对齐到演化目标网络的稳定视觉表示中,从而联结推理与探索。关键地,GLANCE把语言预测与视觉现实之间的差异用作强化学习中的内在好奇心信号,引导智能体主动探索其内部模型不确定的区域。跨一系列智能体任务的大量实验显示GLANCE的有效性,并证明对齐「智能体所想」与「智能体所见」是求解复杂或稀疏智能体任务的关键。
