论文
在端到端 CLI 工具场景中评估基于 LLM 的 0 到 1 软件生成
Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios
摘要
大语言模型 (LLM) 的发展促进了向意图驱动软件开发的范式转变,其中自主代理有望从头开始设计和交付完整的、可运行的软件系统。然而,由于两个基本限制,现有基准无法充分评估这种 0 到 1 的生成能力。首先,它们依赖于预定义的结构支架,这将任务减少到仅仅是文件填充。其次,它们依赖于严格的白盒单元测试,这迫使生成的代码符合特定的内部实现,而不是验证端到端以用户为中心的行为。为了弥补这一差距,我们引入了 CLI-Tool-Bench,这是一种新颖的、与结构无关的基准测试,旨在评估命令行界面 (CLI) 工具的基础一代。该基准测试由自动化黑盒差异测试框架提供支持,包含 94 个高质量的真实存储库,涵盖不同的编程语言和复杂程度。对于每项任务,代理都会获得一个空的工作空间,迫使他们自主处理存储库规划和依赖关系。我们通过在隔离的沙箱中执行生成的软件来评估它。然后使用严格的多层等价度量将系统级副作用和终端输出与人类编写的预言进行比较。对七个最先进的 LLM 的广泛评估表明,顶级模型的最大总体成功率仅为 43.8%,这凸显了 0 到 1 软件生成仍然是一个极具挑战性的前沿领域。此外,我们发现代理表现出生成整体代码结构的强烈倾向,并且较高的词元消耗并不一定会产生更好的任务性能。