论文

所想即所见:经视觉-语言好奇心驱动VLM智能体探索

What You Think is What You See: Driving Exploration in VLM Agents via Visual-Linguistic Curiosity

模型训练强化学习Agentic RL

摘要

为在部分可观测的视觉环境中导航,近期VLM智能体日益把世界建模能力经由显式CoT推理内化进策略,使其能在行动前心理模拟未来。但仅依赖对已访状态的被动推理不足以应对稀疏奖励任务:缺乏主动揭示「已知的未知」的认知驱力,而这对稳健泛化至关重要。我们问:VLM智能体能否通过好奇驱动探索主动寻找能挑战并精炼其内部世界模型的信号?本文提出GLANCE,一个统一框架,把智能体的语言世界模型对齐到演化目标网络的稳定视觉表示中,从而联结推理与探索。关键地,GLANCE把语言预测与视觉现实之间的差异用作强化学习中的内在好奇心信号,引导智能体主动探索其内部模型不确定的区域。跨一系列智能体任务的大量实验显示GLANCE的有效性,并证明对齐「智能体所想」与「智能体所见」是求解复杂或稀疏智能体任务的关键。

所想即所见:经视觉-语言好奇心驱动VLM智能体探索:论文配图
图 2:GLAnCE 框架概述。 GLAnCE 将世界建模和探索统一到一个自我监督的跨模式循环中。左:VLM 代理生成包含未来状态预测 st+1s_{t+1} 的显式推理轨迹。与最终 </pred> 标记相对应的潜在表示通过轻量级投影仪进行映射,以与动量目标视觉编码器编码的视觉现实保持一致。由此产生的预测损失 ℒexplore\mathcal{L}_{\text{explore}} 是好奇心的来源。至关重要的是,来自 ℒexplore\mathcal{L}_{\text{explore}} 的梯度通过冻结的 LLM 反向传播以更新在线视觉编码器,迫使其捕获语义上可操作的特征。右图:VLM 代理在复合奖励 rt=rte+β⋅ℒexplorer_{t}=r_{t}^{e}+\beta\cdot\mathcal{L}_{\text{explore}} 的指导下,通过推出与环境进行交互。这会激励智能体主动访问其内部推理无法解释视觉结果的状态。目标网络通过 EMA 更新以提供稳定的回归锚点。火图标表示可训练模块,而雪花图标表示冻结参数。