论文
MTAC-IFBench:多轮代理编码中的指令跟踪基准测试
MTAC-IFBench: Benchmarking Instruction-Following in Multi-Turn Agentic Coding
摘要
最近,大型语言模型 (LLM) 的快速发展重塑了软件工程,使自主代码代理能够迭代地计划、执行和利用外部工具来处理复杂的任务。除了实现功能正确性之外,这些代理还必须在整个开发生命周期中忠实地遵循流程指令和约束。然而,现有的基准通常侧重于最终功能的正确性或将指令跟踪评估限制在单轮、一般聊天或简单代码生成场景中,从而使多轮代理编码中的指令跟踪尚未得到充分探索。为了弥补这一差距,我们提出了 MTAC-IFBench,这是针对这一关键功能的综合基准测试。它具有多轮渐进式软件开发指令,具有跨越 6 个主要类别和 18 个次要类别的多种约束。每个实例平均有 7.04 个转弯和 91.33 个约束,这对当前的大语言模型提出了严峻的挑战。为了使评估可靠,我们为每个约束和功能需求构建一个清单,并集成验证脚本和判断代理来验证每个清单项目。 MTAC-IFBench 发现现有代码代理在多轮指令跟踪方面存在重大缺陷,随着交互会话时间的延长,其性能会迅速下降。