论文

通过程序化策略搜索为连续游戏合成反应式角色行为

Synthesizing Reactive Character Behaviors for Continuous Games via Programmatic Policy Search

智能体系统Agent 工具调用

摘要

我们提出一种方法,将连续游戏的反应式角色行为合成为紧凑、人类可读的程序。游戏 AI 实践仍高度依赖手工编写的行为树、状态机和脚本,而学术强化学习通常产生不透明的神经控制器,训练昂贵且难以编辑。我们的方法通过直接在面向连续空间游戏策略的领域特定语言上搜索来弥合这一差距。该语言围绕反应式几何决策设计,包含方向最大化等高阶构造。这些构造帮助将连续行为空间离散化为可枚举的程序结构。为使程序搜索实用化,我们引入大量合成反模式,在保留行为覆盖的同时去除冗余程序形式。我们进一步将自底向上的符号枚举与来自编码智能体的自顶向下引导结合。在所得方法 agentic sketching 中,智能体提出高层策略骨架,并调用枚举器补全局部程序槽位。我们在包含 14 个连续游戏的基准上评估该方法,范围从经典控制任务到多智能体足球。我们发现纯枚举往往比单独使用编码智能体更高效,而组合方法大幅超越两者。结果表明程序化策略搜索可以成为游戏 AI 的实用创作工具:设计者只需指定奖励函数,系统即可发现有效、可移植且常常出人意料的可编辑行为。

通过程序化策略搜索为连续游戏合成反应式角色行为:论文配图
图 1:(上) 我们的 ButtonCheese 游戏中老鼠角色的行为,采用智能体草图方法合成的程序。合成器发现了一种出人意料且行之有效的策略:老鼠走向按钮,反复按压以让地图充满奶酪,然后迅速收集奶酪。(下) 最后一行是以我们的角色行为领域特定语言自动合成的策略;前三行定义游戏提供的传感器函数。ButtonCheese 游戏序列展示老鼠反复按压按钮以生成大量奶酪对象并收集它们,其后是合成出的策略程序。