论文
StaminaBench:对 编码智能体 进行超过 100 轮交互的压力测试
StaminaBench: Stress-Testing Coding Agents over 100 Interaction Turns
摘要
我们引入了 StaminaBench,这是一个衡量 编码智能体 耐力的基准:它们在失败之前可以处理多少次连续交互回合(更改请求)。与流行的任务解决分数指标不同,这与真正的振动编码相匹配,其中会话运行数十或数百轮。在 StaminaBench 中,代理实现 REST API 服务器,并通过程序生成的后续更改请求(在我们的实验中为 100 个)的可调数量对其进行修改,从而产生多达 6,000 行的代码库。测试完全以编程方式生成,无需 LLM 参与,确保可重复性和可靠性;更改序列是从硬编码或 LLM 驱动的采样器中提取的,两者都限制在结构化的操作空间中,以确保更改有效。代理和服务器在隔离的环境中运行,并通过 HTTP 与基准进行通信,从而使测试完全黑盒且与语言无关。我们在 20 个场景(每个场景 100 回合)中评估了与 7 个开源 LLM 配对的 6 个智能体Harness,结果发现:(1)所有测试模型在 5-6 回合内失败,证实未经彻底测试的 vivi-coding 风格编程会产生错误; (2) 将测试反馈传递回代理并允许其重试,将通过的回合计数提高多达 12 倍; (3) 强大的性能需要良好的Harness:较强的模型的最佳Harness和最差Harness之间的差距高达 6 倍,而较弱的模型使用任何Harness都会失败。我们发布了基准测试和生成的任务,以便进一步研究多轮 编码智能体 行为。基准代码和数据:github.com/amazon-science/StaminaBench。