论文
仔细看看 Agentic BBO:黑盒优化的 LLM 代理基准测试
A Closer Look at Agentic BBO: Benchmarking LLM Agents for Black-Box Optimization
摘要
黑盒优化 (BBO) 出现在许多科学和工程问题中,这些问题的客观评估成本高昂且有限。最近的大型语言模型(LLM)代理通过结合任务语义、计算、优化工具和反馈驱动的决策提供了一种处理 BBO 的新方法,由于与数学严格工具的集成而显示出巨大的潜力。然而,现有的 Agentic BBO 研究使用不同的任务域和系统配置,使其结果难以比较,并且难以隔离各个设计选择的影响。因此,我们引入了 AgenticBBO-Bench,这是 Agentic BBO 的跨域基准,涵盖统一有限预算评估协议下的合成功能、超参数优化、数据库调整、芯片设计和分子设计。在我们的实验中,Agentic BBO 在所有五个领域中比直接基于 LLM 的方法获得了更高的家庭平均分数,并且在四个领域中优于最好的数值优化器。我们进一步研究影响代理性能的三个因素: 优化工具、任务信息和先验知识,以及LLM在搜索过程中的作用。我们的结果表明,额外的数值工具并不能持续提高性能,任务语义广泛有用,而更具体的先验不太可靠,并且数值优化器可以有效地吸收代理建立的搜索轨迹的收益。最后,我们在 AgenticBBO-Bench 中引入了五任务前沿挑战,并在 Codex 代理工具下评估了七个 LLM,其中 GPT-6 Astra 和 DeepSeek-V4.1-Flash 位于评估模型中性能和成本的帕累托前沿。我们的代码可在 https://github.com/lamda-bbo/agentic-bbo. 获取