论文
事关TASTE:提升Agent基准的覆盖面与难度
A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks
摘要
随着Agent能力的提升,$\tau^2$-Bench等现有基准正日趋饱和。然而,构建新的基准任务仍然复杂、昂贵且耗费人力。此外,标准做法先以自然语言撰写场景、再映射到工具序列,只能覆盖Agent所涉工具使用模式的狭窄子集。本文通过反转任务构建过程来解决这些问题。我们提出TASTE(Task Synthesis from Tool Sequence Evolution),一种自动生成具有更广工具使用覆盖的富挑战性任务的方法。TASTE利用在LLM判定的有效性信号上训练的自适应对比$n$-gram模型。这使采样能够覆盖大量工具组合的有效工具序列成为可能。随后TASTE通过聚类从序列池中选出代表性序列,将其实例化为完整基准任务,并通过迭代难度演化加以精炼。利用TASTE,我们构建了$\tau^c$-Bench,$\tau^2$-Bench三个领域的挑战性扩展。我们评估了11对agent/用户LLM组合,发现接近$\tau^2$-Bench饱和的模型在我们的任务上出现严重性能下滑(例如Gemini-3-Flash从$0.82\!-\!0.94$跌至$0.28\!-\!0.61$)。除提高难度外,我们生成的任务还将Agent必须执行的独特工具组合数量增加了一倍以上。我们的结果表明,现有基准上的高分往往反映饱和而非稳健的任务解决能力。通过自动化生成困难、高覆盖的基准,TASTE使对未来Agent的持续、可扩展评估成为可能。
