论文
了解 LLM 迭代生成优化中的挑战
Understanding the Challenges in Iterative Generative Optimization with LLMs
摘要
生成优化使用 大语言模型 (LLM) 通过执行反馈迭代改进工件(例如代码、工作流或提示)。这是构建自我改进智能体的一种很有前景的方法,但在实践中仍然很脆弱:尽管进行了积极的研究,但只有 9% 的受访智能体使用了任何自动化优化。我们认为,这种脆弱性的出现是因为,为了建立学习循环,工程师必须做出“隐藏”的设计选择:优化器可以编辑什么以及每次更新时要提供的“正确”学习证据是什么?我们研究了影响大多数应用程序的三个因素:启动工件、执行跟踪的信用期限以及将试验和错误批量化为学习证据。通过 MLAgentBench、Atari 和 BigBench Extra Hard 的案例研究,我们发现这些设计决策可以决定生成优化是否成功,但在之前的工作中很少明确说明。不同的起始工件决定了 MLAgentBench 中可以达到哪些解决方案,截断的跟踪仍然可以改进 Atari 代理,并且较大的小批量不会单调地改进 BBEH 上的泛化。我们的结论是,缺乏一种简单、通用的方法来建立跨领域的学习循环是生产和采用的主要障碍。我们为做出这些选择提供实用指导。