论文
通过程序化策略搜索为连续游戏合成反应式角色行为
Synthesizing Reactive Character Behaviors for Continuous Games via Programmatic Policy Search
摘要
我们提出一种方法,将连续游戏的反应式角色行为合成为紧凑、人类可读的程序。游戏 AI 实践仍高度依赖手工编写的行为树、状态机和脚本,而学术强化学习通常产生不透明的神经控制器,训练昂贵且难以编辑。我们的方法通过直接在面向连续空间游戏策略的领域特定语言上搜索来弥合这一差距。该语言围绕反应式几何决策设计,包含方向最大化等高阶构造。这些构造帮助将连续行为空间离散化为可枚举的程序结构。为使程序搜索实用化,我们引入大量合成反模式,在保留行为覆盖的同时去除冗余程序形式。我们进一步将自底向上的符号枚举与来自编码智能体的自顶向下引导结合。在所得方法 agentic sketching 中,智能体提出高层策略骨架,并调用枚举器补全局部程序槽位。我们在包含 14 个连续游戏的基准上评估该方法,范围从经典控制任务到多智能体足球。我们发现纯枚举往往比单独使用编码智能体更高效,而组合方法大幅超越两者。结果表明程序化策略搜索可以成为游戏 AI 的实用创作工具:设计者只需指定奖励函数,系统即可发现有效、可移植且常常出人意料的可编辑行为。
