论文

OPT-BENCH:评测LLM智能体在大规模搜索空间中的迭代自优化

OPT-BENCH: Evaluating the Iterative Self-Optimization of LLM Agents in Large-Scale Search Spaces

智能体系统Agent任务评测

摘要

大语言模型(LLM)在推理和工具使用方面表现出了卓越的能力。然而,解决问题所必需的基本认知能力,包括感知、推理和记忆,仍然是智力的稳定核心。与记忆特定模式不同,人类通过运用这些内在能力来适应和优化,从而在新环境中取得成功。然而,LLM是否具备这种基本能力,即根据动态环境反馈不断完善解决方案的能力,仍有待探索。为了应对这一挑战,我们引入了 OPT-BENCH,这是一个评估大规模搜索空间中自我改进能力的基准。通过将 20 个机器学习任务与 10 个经典 NP 难题相结合,OPT-BENCH 提供了一个严格的设置来评估智能体是否可以通过内在的自我反思而不是死记硬背的工具应用来适应。我们进一步提出了 OPT-Agent,一个模拟类人认知适应的框架。它通过一般感知、记忆和推理循环进行操作,根据环境反馈迭代地完善解决方案。通过对来自 7 个模型系列(包括推理模型、通用模型和从 3B 到 235B 参数的开源模型)的 19 个 LLM 进行的广泛实验,我们证明了更强的模型在利用反馈信号进行自我改进方面更有效。然而,这种上限适应性仍然从根本上受到模型基础能力的限制,即使是最先进的LLM仍然达不到人类专家的表现。

OPT-BENCH:评测LLM智能体在大规模搜索空间中的迭代自优化:论文配图
图 2:OPT-BENCH 数据集和 OPT-Agent 框架概述。左图展示了 OPT-Bench 的数据结构,包含 ML 和 NP 问题。每个模块包括问题定义、数据集文件、验证脚本(NP)、评估指标和提交格式,集成了人工验证的初始解决方案和LLM辅助的细化。右侧面板详细介绍了评估工作流程,其中解决方案是按步骤迭代生成和验证的。有效的解决方案继续进行度量计算,而有缺陷的解决方案则通过 LLM 或基于规则的诊断触发错误分析,然后进行迭代优化。该框架可以对LLM跨不同问题领域的优化能力进行系统化和自动化的评估。