论文

面向控制的代码进化:通过 LLM 驱动的进化搜索合成策略

Code Evolution for Control: Synthesizing Policies via LLM-Driven Evolutionary Search

模型推理推理搜索与路径规划

摘要

为自主系统设计有效的控制策略仍是一项根本性挑战,传统上通过强化学习或人工工程来解决。强化学习虽已取得显著成功,但常受困于高样本复杂度和奖励塑形困难,且产生难以解释或验证的不透明神经网络策略。另一方面,人工设计需要大量领域专业知识,并难以扩展到多样化任务。在本工作中,我们证明 LLM 驱动的进化搜索能够有效地以可执行代码的形式合成可解释的控制策略。通过将策略合成视为代码进化问题,我们利用 LLM 对编程模式和控制启发式的先验知识,同时采用进化搜索系统地探索解空间。我们使用 EvoToolkit 实现该方法,该框架将 LLM 驱动的进化与可自定义的适应度评估无缝集成。我们的方法迭代地进化候选策略程序种群,依据任务特定目标对其进行评估,并选择更优的个体用于繁殖。这一过程产生紧凑、人类可读的控制策略,可直接检查、修改和形式化验证。这项工作凸显了将基础模型与进化计算相结合、为自主系统合成可信控制策略的潜力。代码见 https://github.com/pgg3/EvoControl。