论文
COMPAS:用于优化代码生成的难度感知联合搜索
COMPAS: Difficulty-Aware Joint Search for Optimizing Code Generation
摘要
代码生成系统使每个 LLM 调用都带有模型、提示和解码设置。然而,现有的优化方法通常只调整这些选择的一部分,或者对所有任务使用一种固定配置:全局优化器为所有任务搜索一种配置,路由器仅选择一个模型,提示优化器保持模型和解码设置固定。这使得他们联合的、特定群体的互动变得不清楚。因此,我们检查这些选择如何相互作用,并观察提示和解码设置相互作用,调整效果因模型而异,最佳配置因任务难度而异。在这些观察的指导下,我们引入了 COMPAS(模型、提示和解码设置的代码生成优化),这是一种难度感知方法,通过低成本模型选择和联合提示解码搜索来学习特定组的质量成本前沿,然后将每个测试任务路由到其在线匹配前沿,而无需进一步搜索。在 LiveCodeBench 上匹配的搜索预算下,COMPAS 将 pass@1 从最佳基线的 45.9% 提高到 52.8%,同时将成本从 36.57 美元降低到 4.92 美元。这也转移到 SWE-bench 上的存储库级代码生成,解决了 76.0% 的任务,而最佳基线为 70.0%。代码和重现性工件可在 https://github.com/gjz78910/COMPAS 上获取。