论文
用于贝叶斯优化中自适应采集的多代理 LLM
Multi-Agent LLMs for Adaptive Acquisition in Bayesian Optimization
摘要
探索-利用权衡是顺序决策和黑盒优化的核心,但 大语言模型 (LLM) 如何推理和管理这种权衡仍然知之甚少。与贝叶斯优化不同,贝叶斯优化通过获取函数显式编码探索和利用,基于 LLM 的优化依赖于对历史评估的隐式、基于提示的推理,使得搜索行为难以分析或控制。在这项工作中,我们提出了 LLM 介导的搜索策略学习的度量级别研究,研究 LLM 如何在探索的多种操作定义(包括信息性、多样性和代表性)下构建和调整探索开发策略。我们表明,在单个提示内联合执行策略选择和候选生成的单代理 LLM 方法会遭受认知过载,导致不稳定的搜索动态和过早收敛。为了解决这个限制,我们提出了一个多智能体框架,将探索-利用控制分解为战略政策调解和战术候选生成。策略代理将可解释的权重分配给多个搜索条件,而生成代理则根据定义为权重的结果搜索策略生成候选。这种分解使得探索-利用决策变得明确、可观察和可调整。各种连续优化基准的经验结果表明,将战略控制与候选生成分开可以显着提高 LLM 介导的搜索的有效性。