论文

超越预测:通过回顾性世界建模指导 VLM Agent

Beyond Prediction: Steering VLM Agents with Retrospective World Modeling

模型训练强化学习

摘要

为 VLM Agent配备世界建模能力已显示出复杂推理和长期规划的强大潜力,同时减少了政策学习对昂贵的现实世界交互的依赖。现有方法主要依靠前瞻性模拟来预测候选行为的后果。然而,这种只向前的范式关注接下来会发生什么,并为验证一个动作是否与观察到的状态转换因果一致提供了有限的约束,这可能导致看似合理但物理上不连贯的行为。在本文中,我们挑战了世界建模仅作为前瞻性预测的观点,并引入了回顾性世界建模,这是一种新的智能体学习范式,它使智能体能够通过估计最有可能导致给定转换的动作的回顾性归因分布 $P(\hat{a}{t}|s_t, s{t+1})$ 来进行向后推理。基于这种能力,我们制定了自我一致性奖励(SCR),这是衡量政策行动与回顾性解释之间概率一致性的内在信号。将 SCR 集成到强化学习中可以提供密集的过渡级反馈,并引导智能体采取既有效执行任务又具有物理基础的行为。跨不同 Agentic 任务的广泛实验表明,与仅前瞻性世界建模基线相比,我们的方法大大提高了策略的鲁棒性和泛化性。