论文
当前Agent未能将世界模型用作前瞻工具
Current Agents Fail to Leverage World Model as Tool for Foresight
摘要
基于视觉语言模型构建的Agent越来越多地面临需要预判未来状态而非依赖短程推理的任务。生成式世界模型提供了一条有希望的补救途径:Agent可以将其作为外部模拟器,在行动前预演结果。本文实证考察当前Agent能否将此类世界模型作为工具来增强自身认知。在多样的Agentic任务与视觉问答任务上,我们观察到部分Agent极少调用模拟(不足1%),经常误用预测的rollout(约15%),并且在模拟可用或被强制启用时表现出不一致甚至下降的性能(最高达5%)。归因分析进一步表明,主要瓶颈在于Agent决定何时模拟、如何解读预测结果以及如何将前瞻整合进下游推理的能力。这些发现凸显了建立能促进校准化、有策略地与世界模型交互的机制的必要性,为未来Agent系统实现更可靠的前瞻认知铺平道路。
