论文

REFLEX:LLM 经验的反思进化

REFLEX: Reflective Evolution from LLM Experience

智能体系统Agent 架构与控制循环

摘要

大型多模态语言模型(LLM)已成为指导进化搜索走向可解释的编程策略的强大工具。然而,现有框架依赖于整体模型调用来同时解释视觉行为证据并合成纠正代码。这种诊断-修复纠缠创建了一个不透明的反馈循环,模糊了突变背后的基本原理,并阻止了独立运行中算法见解的保留。为了实现可审计且高效的策略搜索,我们认为视觉诊断必须在结构上与代码生成解耦。我们提出了 REFLEX,一个无需训练的进化框架,可以实现这种解耦。在 REFLEX 中,具有视觉能力的 Critic 首先将特定于任务的行为证据提炼成结构化的、可审核的诊断。随后,文本优化的 Actor 使用这些诊断以及可重用代码片段的持久、自我进化的技能记忆来合成子策略。该架构不仅提供透明的突变跟踪,而且还支持跨运行的编程知识转移。跨控制基准(Lunar Lander、Acrobot、Pendulum)和 36 维天线阵列合成任务的广泛评估证明了卓越的样本效率。值得注意的是,REFLEX 在 10 次 LLM 调用内解决了 Acrobot 和 Pendulum 问题,并在 Lunar Lander 上达到了 1.092 的最佳归一化加权分数,实现了极具竞争力的最终性能,同时显着加速了透明策略的早期发现。