论文
T1-Bench:面向多领域交互任务的Agent评测
T1-Bench: Benchmarking Multi-Scenario Agents in Real-World Domains
摘要
大语言模型 (LLM) 推理和工具调用功能的最新进展使得代理系统的能力日益增强。然而,现有的基准在任务复杂性、现实性和领域多样性方面仍然有限,并且通常无法捕获跨越多个领域的交互,从而限制了它们在需要持续推理和协调的现实多步骤设置中评估代理的能力。为了解决这些限制,我们引入了 T1-Bench,这是一种高保真、全面的基准,用于在现实的面向客户的多域环境中评估代理系统,其特点是交错场景,需要跨多轮用户辅助交互进行结构化推理,并显着提高跨 25 个不同难度领域的组合复杂性和评估严谨性。我们使用 12 个专有和开放权重模型来评估 T1-Bench,提供可重复的标准化框架,用于评估复杂、多步骤环境中的代理行为、工具利用率和对话质量。我们进一步用人类判断来补充自动评估,以加强对定性绩效的评估。总体而言,T1-Bench 通过增加模拟多域环境中的任务复杂性、交互深度和域覆盖范围,大幅提升了之前的基准测试。为了方便未来对代理系统的研究,我们将开源公开发布数据和评估代码。