论文

DeployBench:对研究工件部署的 LLM 代理进行基准测试

DeployBench: Benchmarking LLM Agents for Research Artifact Deployment

智能体系统Agent任务评测

摘要

LLM 代理在软件工程和机器学习研究任务方面取得了快速进展,但这些进步通常需要访问工作的可运行环境。对于与已发表论文一起发布的研究成果来说,从新机器上建立这样的环境仍然是一个主要瓶颈。现有的环境设置基准并未涵盖研究工件部署的全部范围,其中涉及多语言工具链、容器之外的系统级依赖项(例如 GPU/CUDA 和内核配置)以及遗留工件兼容性。我们推出 DeployBench,这是一个包含 51 个研究工件部署任务的多领域基准测试,涵盖 AI/ML、计算机系统和科学计算,涵盖所有这些维度。每个任务都由一个隐藏的管道进行验证,该管道执行论文指定的实验并检查其输出。使用 OpenHands 评估五个最先进的 LLM 的通过率在 7.8%-51.0% 之间。失败主要是完成判断问题:181 个中的 102 个是代理终止的自停止,其中代理的完成前检查验证了与特定于论文的任务所需的不同或较弱的目标。 DeployBench 强调了当前代理与自主部署之间的差距,并为科学研究代理提供了一个现实的测试平台。