论文
CODA-BENCH:代码智能体能处理数据密集型任务吗?
CODA-BENCH: Can Code Agents Handle Data-Intensive Tasks?
摘要
高级智能体越来越多地展示出作为自主工程师运作的潜力,从而对捕捉现实世界开发复杂性的评估基准产生了日益增长的需求。此类环境通常涉及复杂的代码和大规模数据(即文件系统)。然而,现有的基准测试通常孤立地评估以代码为中心或以数据为中心的功能,与真实的开发场景存在明显差距。在本文中,我们通过引入 CODA-BENCH 来弥补这一差距,CODA-BENCH 是第一个在数据密集型环境中联合评估代码和数据智能的基准。我们基于 Kaggle 生态系统(包含数百个数据集)构建了一个数据密集型 Linux 沙箱,其中代理必须主动探索复杂的文件层次结构以识别相关资源并为数据驱动的分析任务生成代码。 CODA-BENCH 包含跨越 31 个社区的 1,009 个任务,每个任务环境平均包含 980 个文件,模拟真实的数据规模和噪声。对高级代理的评估表明,即使是性能最好的系统也难以有效地将数据发现与代码执行相结合,成功率仅为 61.1%。这些结果凸显了当前数据密集型任务的代理能力存在巨大差距,并为未来的研究指明了有希望的方向。
