论文
ICAE-Bench:把编码智能体作为交互式项目构建者评估
ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders
摘要
vibe-coding工作流的近期涌现正在改变对编码智能体的期待:智能体不再只是在完全指明的指令下补全代码,而是被期待通过组合规划、需求澄清、工具使用、调试与仓库级构建等多种能力,把不完整的产品意图转化为可运行软件。但既有基准尚未跟上这一转变——它们在静态、完全指明的任务上评估智能体。本文提出ICAE-Bench,一个在交互式项目构建设定下评估编码智能体的基准。基本思想是从模糊的产品需求出发、以自动化的用户智能体仿真动态范式。为使该设定既现实又可评估,ICAE-Bench引入三项关键设计:第一,为避免无约束模糊需求的歧义,每个任务从具有可执行行为的精确真实开源仓库派生歧义;第二,为确保高质量可复现的用户仿真,ICAE-Bench以用户智能体数据落地交互——使用户智能体能揭示隐藏约束而不发明新需求、不泄漏实现工件;第三,为公平评估开放式仓库,ICAE-Bench以标准化黑盒测试加多维诊断——功能正确性、语义与API相似度、结构保真度、设计质量与交互质量。
