论文

SAGA:面向长程策略游戏规划的场景感知目标演化智能体

SAGA: Scene-Aware, Goal-Evolving Agents for Long-Horizon Strategy Game Planning

智能体系统Agent 规划

摘要

文明类大策略游戏面临独特的长程规划问题:智能体必须在部分可观测下把一个共享资源池分配给六个竞争领域——科技、政府、外交、城市发展、扩张与军事——除延迟终分外无反馈。当前LLM智能体在三个方面不足:1) 不能从原始坐标推断空间关系;2) 资源分配差——把不断增长的状态全部塞入一个提示并在单一输出中规划所有领域会分散注意力;3) 无法改进——延迟终分在局内与跨局都不提供信号。我们提出SAGA:(i) 地图语义场景图把坐标转为逐实体的距离、方向与威胁声明;(ii) 工具增强规划器只检索决策所需的状态、削减输入量级,并向六个专职控制器发出每个领域的独立计划;(iii) 双时域反馈回路在局中设定短期目标并从每局蒸馏教训供下一局使用。在CivRealm基准上:SAGA在平均终分上领先五个LLM基线,城市发展显著超前,输出token少27%。

SAGA:面向长程策略游戏规划的场景感知目标演化智能体:论文配图
图 1:决策复杂性情况。向右,结果反馈会在更长的范围内到达(挑战 3);向上,更多的决策域耦合(挑战2);两个轴后面的地图规模观察产生了挑战 1。CivRealm 占据极端状态,SAGA 将一种机制与每个挑战配对(§3)。