论文

持续改进和并行自主探索:用于搜索大型解决方案空间的 LLM-Agent 框架

Continuous Improvement and Parallel Autonomous Exploration: An LLM-Agent Framework for Searching Large Solution Spaces

智能体系统Agent 架构与控制循环

摘要

我们提出了一个框架,为 LLM 代理提供两种自主搜索大型解决方案空间的机制。首先,对保留数据进行评分的排行榜充当奖励信号,促使每个代理在重复提交的情况下完善其解决方案,即使单个代理也可以运行这个循环。其次,该框架允许并行、完全自主地运行多个代理,循环中无需人工:代理独立分析、调查方法、实施、自我评估、提交和修改,而仲裁代理仅处理后勤工作。在共享奖励下并行运行代理拓宽了解决方案空间的探索区域,而不是完善单种子范式。我们实例化了产品与目录匹配的框架(具有大型类别结构解决方案空间的核心电子商务检索任务),表现为具有精确覆盖操作点的选择性预测。单个智能体在其种子范式内进行改进,而并行自主智能体则呈现出性质不同的解决方案。在此测试平台上,最佳合格覆盖率(每个类别 >=95% P@1)在单一药剂时达到 47.8-57.4%,在五种药剂时达到 62.8-69.4%,而基线为 33.3%。我们的贡献是框架本身:一个持续改进的奖励循环和完全自主并行探索的基础,并有案例研究证据的支持。