论文
OPT-BENCH:评测LLM智能体在大规模搜索空间中的迭代自优化
OPT-BENCH: Evaluating the Iterative Self-Optimization of LLM Agents in Large-Scale Search Spaces
摘要
大语言模型(LLM)在推理和工具使用方面表现出了卓越的能力。然而,解决问题所必需的基本认知能力,包括感知、推理和记忆,仍然是智力的稳定核心。与记忆特定模式不同,人类通过运用这些内在能力来适应和优化,从而在新环境中取得成功。然而,LLM是否具备这种基本能力,即根据动态环境反馈不断完善解决方案的能力,仍有待探索。为了应对这一挑战,我们引入了 OPT-BENCH,这是一个评估大规模搜索空间中自我改进能力的基准。通过将 20 个机器学习任务与 10 个经典 NP 难题相结合,OPT-BENCH 提供了一个严格的设置来评估智能体是否可以通过内在的自我反思而不是死记硬背的工具应用来适应。我们进一步提出了 OPT-Agent,一个模拟类人认知适应的框架。它通过一般感知、记忆和推理循环进行操作,根据环境反馈迭代地完善解决方案。通过对来自 7 个模型系列(包括推理模型、通用模型和从 3B 到 235B 参数的开源模型)的 19 个 LLM 进行的广泛实验,我们证明了更强的模型在利用反馈信号进行自我改进方面更有效。然而,这种上限适应性仍然从根本上受到模型基础能力的限制,即使是最先进的LLM仍然达不到人类专家的表现。
