论文

MirrorCode:AI可以仅从行为重建整个程序

MirrorCode: AI can rebuild entire programs from behavior alone

智能体系统Agent任务评测

摘要

AI模型在自主编码上快速进步。但既有编码基准聚焦较短任务,一次性演示难以系统比较。我们引入MirrorCode:基于重新实现整个软件项目的长程编码基准。MirrorCode要求AI智能体复刻既有程序的功能——不访问其源码;AI解必须在端到端测试上精确匹配原程序输出,包括留出测试。MirrorCode的25个目标程序横跨不同计算领域:Unix工具、数据序列化与查询工具、生物信息学、解释器、静态分析、密码学与压缩。既有AI模型已经能重新实现复杂软件——最强模型基准得分56%。例如,AI能重新实现gotree——一个16,000行的生物信息学工具包。但研究性能前沿需要比典型基准更大的推理预算——例如单个大任务一次尝试需2,600美元、19天。结果表明AI智能体已能完成长程软件工程任务,尤其当需求被精确指定时。