论文
EngramBench:基于能力的技能进化Harness基准
EngramBench: A Capability-Grounded Benchmark for Skill-Evolution Harnesses
摘要
虽然大语言模型在隔离代码生成方面取得了显着的成功,但真正的软件工程需要持续的推理、复杂的状态管理和持续的跨域抽象。然而,当前对自主Agent技能进化的评估遇到了一个关键的可识别性问题:它们在结构上将真正的能力抽象与死记硬背的解决方案泄漏(即从历史训练数据中复制高度相似的代码)混为一谈。为了解决这个问题,我们引入了 EngramBench,这是一个严格的、基于能力的基准测试,受能力重叠且没有解决方案重叠的严格公理的约束。 EngramBench 包含 30 种不同的学习任务和 13 种看不见的迁移任务,挑战Agent在 LLM 模拟用户驱动的交互式、多小时的开发周期中进行导航。我们对 48 个多小时的执行轨迹进行了广泛的评估,并得到了人类专家验证的证实,揭示了对程序记忆的深刻见解。我们证明静态技能库不会神奇地绕过精确代码实现的“最后一英里”,这仍然受到基本模型固有推理限制的瓶颈。然而,它们是不可或缺的执行指南针。通过引导Agent远离灾难性的、大量词元的试错,真正的能力抽象减少了冗余的上下文膨胀,并将总体编码时间减少了 55% 以上。最终,EngramBench 将评估范式从琐碎的模式匹配转变为深度、跨域能力转移的可验证测量。