论文

ICAE-Bench:把编码智能体作为交互式项目构建者评估

ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders

智能体系统Agent任务评测

摘要

vibe-coding工作流的近期涌现正在改变对编码智能体的期待:智能体不再只是在完全指明的指令下补全代码,而是被期待通过组合规划、需求澄清、工具使用、调试与仓库级构建等多种能力,把不完整的产品意图转化为可运行软件。但既有基准尚未跟上这一转变——它们在静态、完全指明的任务上评估智能体。本文提出ICAE-Bench,一个在交互式项目构建设定下评估编码智能体的基准。基本思想是从模糊的产品需求出发、以自动化的用户智能体仿真动态范式。为使该设定既现实又可评估,ICAE-Bench引入三项关键设计:第一,为避免无约束模糊需求的歧义,每个任务从具有可执行行为的精确真实开源仓库派生歧义;第二,为确保高质量可复现的用户仿真,ICAE-Bench以用户智能体数据落地交互——使用户智能体能揭示隐藏约束而不发明新需求、不泄漏实现工件;第三,为公平评估开放式仓库,ICAE-Bench以标准化黑盒测试加多维诊断——功能正确性、语义与API相似度、结构保真度、设计质量与交互质量。

ICAE-Bench:把编码智能体作为交互式项目构建者评估:论文配图
图 1:ICAE-Bench 交互式需求澄清设置概述。考虑到不明确的需求,氛围编码通过人类和编码代理之间的对话来解决缺失的设计决策。我们的基准测试使用用户代理来模拟此过程,该用户代理回答澄清问题并指导编码代理制定完整的、可测试的规范,然后将其用于构建工作存储库。