论文

控制代码:综合参数化反应控制器

Code to Control: Synthesizing Parameterized Reactive Controllers

智能体系统Agent 架构与控制循环

摘要

最近基于 LLM 的控制方法要么调用语言模型来选择操作,要么合成需要在每个决策中进行规划的世界模型,从而引入可能限制实时使用的延迟。我们引入了 Code to Control,这是一种合成 Python 控制器并直接作为策略执行的方法。控制代码将程序结构与参数分开。 LLM 综合了控制器结构,而无导数搜索则使用环境反馈来拟合其参数以进行连续控制。一旦学习,生成的控制器既不需要 LLM 推理,也不需要在决策时进行规划,从而实现实时游戏,并且在我们的计时协议下,比 PPO 策略更快的动作选择。在一系列 Atari 游戏、Flappy Bird 和 MuJoCo 任务中,Code to Control 的性能优于基于规划的程序合成方法,在使用更少的环境交互的同时保持与深度强化学习的竞争力,在环境动态的重大变化中进行迁移,并扩展到复杂的运动任务。