论文

OptiArena:LLM能否在固定资源预算下改进可执行算法?

OptiArena: Can LLMs Improve Executable Algorithms under Fixed Resource Budgets?

智能体系统Agent任务评测

摘要

静态 QA 和代码生成基准仅部分体现了大语言模型 (LLM) 现在作为编码Agent和研究工具所发挥的作用。我们引入了 OptiArena,这是一个预算控制的测试平台,用于研究LLM是否可以通过在固定的最小支架内、在有限的评估者反馈和固定的资源预算下进行五轮代码编辑来改进可执行的游戏算法。该测试平台使用两种优化机制、表面模糊控制、校准参考、保留/应力分割以及退化和异常故障诊断,LLM API 成本与本地评估器挂钟分开报告。实证研究提出了三个问题:模型是否可以缩小指定的弱启动器和可编辑的合格基线之间的校准差距,是否可以在不损坏可编辑的合格基线的情况下完善它们,以及增益是否能够经受表面混淆控制。在 12 个前沿LLM和 5 个游戏中,模型对指定的弱启动器的改进比对可编辑的能力基线的改进更加一致,并且游戏和模型之间存在很大差异。 OptiArena 提供了一个实用的测试平台,用于测量此处研究的五次编辑、固定支架设置中的有限资源算法优化。代码可在 https://github.com/WJ-Peng/OptiArena. 获取