论文

掌握 PokeGym:测试时的图引导多模态进化

Mastering PokeGym: Graph-Guided Multimodal Evolution at Test Time

智能体系统Agent任务评测

摘要

虽然人工智能已经掌握了国际象棋和围棋等结构化游戏,但视觉语言代理在无法访问游戏状态的视觉驱动 3D 游戏中仍然举步维艰。现有的游戏环境通常评估固定的代理配置,而不是代理在同一任务的连续剧集中改进其配置的能力,这种范式称为测试时学习 (TTL)。此外,当前的 TTL 方法通常单独优化单一模式(例如文本提示或操作),忽略感知、推理和控制之间的协同作用。为了弥补这些差距,我们首先引入 \textbf{PokeGym},这是一个基于 3D 开放世界游戏 Pokémon Legends: Z-A 构建的长期基准测试,其中智能体根据视觉观察进行操作,无需访问游戏状态,旨在评估智能体在任务的连续剧集中学习和适应的能力。为了应对这种具有挑战性的环境,我们提出了图引导进化多模态代理配置(\textbf{G-EvoMAC}),这是一种图引导框架,可以协同地联合优化视觉感知、策略和动作集。大量实验表明,G-EvoMAC 在 PokeGym 上实现了 60.18% 的平均成功率,比最强基线高出 11 个百分点以上,验证了跨模态协同进化的威力。