论文
Agent可以为Agent设计库吗?
Can Agents Design Libraries for Agents?
摘要
Agent越来越多地构建在其他Agent编写的代码上,并且它们重新实现而不是重用,从而扩展了以后Agent必须工作的代码库。为了衡量Agent为其他Agent设计库的效果,我们引入了 LibraryDesignBench,这是一个两阶段基准,其中Agent根据规范实现全功能库,该规范定义了所需的功能和潜在用例,而无需规定设计。我们通过来自不同模型系列的三个用户Agent编写的程序的正确性和简单性来评估该库。该基准测试涵盖 4 种语言的 15 个库设计任务中的 242 个经过专家验证的编程问题。在十五项任务中的十一项中,Agent设计者再现了人类编写的生产库的抽象。下游Agent采用类似的Agent库和人工编写的库,但未充分利用它们,从而重新实现了库已提供的功能。我们的故障分析发现,下游Agent编写额外的代码主要是因为Agent编写的库僵化或难以使用,而不是因为功能缺失。我们还尝试为设计师提供更多规范性的、Agent优先的指导,并让他们使用子Agent测试他们的库;这提高了下游分数并产生更简单的程序。 LibraryDesignBench 既提供了一个用于评估Agent用户的库设计实践的测试平台,也提供了一个可提高下游重用的初始设计基线。