论文

LLM 游戏代理基于环境的自动提示优化

Environment-Grounded Automated Prompt Optimization for LLM Game Agents

智能体系统Agent Harness

摘要

交互式环境中的 LLM 代理对其提示高度敏感,但提示工程仍然是一个手动的、特定于任务的过程。我们为 LLM 代理引入了一个自动提示优化框架,该框架将观察到行动的管道分解为目标条件描述符代理和操作选择代理,并通过由环境返回引导的 LLM 驱动的进化循环迭代地细化每个模块的提示。我们提出了一个行为分析器,将事件结果归因于特定的提示组件,并提出了一个变异器,在通过环境执行轨迹验证它们之前,对提示提出有针对性的修改。我们评估了 BALROG 基准中的所有五个 BabyAI 任务,在简单和引导提示初始化下将我们的管道与 BALROG 的 RobustCoTAgent 进行比较。优化可以跨任务和条件一致地提高性能,而无需更新模型权重。在 PutNext(一个多步骤协调任务,RobustCoTAgent 的成功率为 0%)上,我们的框架使用相同的底层 LLM 和优化的提示,成功率高达 72.5%。这些结果表明,多代理框架与自动提示优化相结合,可以增强 LLM,而不需要 微调 或广泛的人工监督。