论文
MMENTO:记忆引导模因代码作为策略的进化
MEMENTO: Memory-Guided Memetic Code-as-Policy Evolution
摘要
长期具体任务需要在观察到任务成功之前执行许多相关操作的策略。将策略表示为可执行的控制程序(代码即策略)可以在执行轨迹评估后检查和修改其决策逻辑。然后可以执行修改后的程序,并通过执行轨迹性能进行比较,将策略改进框架为执行引导的程序搜索。 大语言模型 (LLM) 驱动的进化方法通过生成变体和选择高性能候选者,为这种搜索提供了一种自然的机制。然而,现有的方法主要在独立生成的变体中进行选择,并且缺乏连续的局部改进阶段。我们介绍了 MMENTO,一种用于代码即策略演化的记忆引导单精英模因框架。 MEMENTO 首先开发了一个执行轨迹评估器,将政策执行轨迹映射到标量适应度和结构化反馈指标。适应性选择被接受的候选程序和下一个精英,而反馈指标则影响由记忆引导的爬山、宏观突变和交叉产生的政策建议。我们在两个长期具体领域评估 MMENTO:Robosuite Franka 河内塔操作和 AI2-THOR 家庭互动。 MMENTO 在任务成功和泛化到保留的 Robosuite 对象配置和未见过的 AI2-THOR 场景方面优于 Eureka 和 REvolve,被改编为代码即策略进化基线。消融表明,零样本生成和未进化的评估器无法解决任一领域,并且删除策略搜索分支会降低性能。最后,我们在物理 Franka 机器人上部署了最佳进化的 Robosuite 策略,证明了进化的代码即策略的模拟到真实迁移的可行性。代码、提示和视频位于:https://github.com/sygkounas/MMENTO。