论文

SPIKE:用于经济高效的长视野游戏代理的自适应双控制器框架

SPIKE: An Adaptive Dual Controller Framework for Cost-Efficient Long-Horizon Game Agents

智能体系统Agent 架构与控制循环

摘要

开放世界游戏中的长视野多模式代理必须在紧张的词元和延迟预算下,在许多低级交互中保持目标导向。现有的方法通常会权衡成本高昂的每步推理与可能漂移、重复失败和恢复不良的反应式执行。我们的关键思想是在局部稳定的部分中重用策略推理,并在事件边界重新调用它。我们推出 SPIKE,一种自适应双控制器框架,用于经济高效的长视野游戏控制。其战略控制器执行低频全局规划、故障分析和恢复,而其反应控制器则在严格的 词元预算 下处理快速本地执行。事件触发器监视视觉变化、任务进度、重复操作和失败信号,以决定控制何时应保持反应或升级为战略推理。分层记忆将状态动作记忆库 (SA-MB) 中的短期经验重用与状态动作知识图 (SA-KG) 中的结构化证据分开,允许每个控制器检索其所需的上下文。这种设计在多个反应步骤中重用战略建议,在计划过时时支持本地覆盖,并在需要额外深思熟虑的时刻保留昂贵的推理。在 StarDojo 的 Lite-100 拆分中,SPIKE 将 Lite-100 成功率 (SR) 比最强的 Lite-100 基线提高了 5.0 个百分点(相对 38.5%),将预算 SR 比最强的预算基线提高了 9.3 个百分点(相对 75.6%)。它还将词元消耗减少了 54.9%,延迟减少了 40.8%。消融表明,事件触发、反应性覆盖和异构记忆都有助于成功和恢复,支持选择性推理,而不是每一步都推理。