论文
τ²-Bench:一个用于端到端、真实场景下智能体构建的环境
$τ^τ$-Bench: An Environment for End-To-End, Realistic Agent Construction
摘要
大语言模型智能体正迅速成为生产级软件,用于处理客户服务、裁决纠纷和操作内部系统。值得注意的是,其构建工作越来越多地交由编码智能体完成,但现有基准对AI系统在真实客户交互场景下能否交付智能体知之甚少。我们提出了τ²-bench(发音为hyper-tau-bench),将智能体构建本身作为评测任务。开发智能体被赋予企业实际保存的记录、持有需求的客户、必须通过的生产API、可继承的代码库,以及服务成本和模型使用的限制——这正是真实业务场景提供的起点。基于这些条件,智能体必须交付一个完整的客户服务智能体,并通过将其部署到未参与的模拟用户中进行评分。在涵盖四个领域的53项任务中,最强配置(Claude Opus 5在Claude Code模型下)仅通过23.9%的评估模拟,而由专家撰写的参考上限得分达82.2%。失败原因与人类智能体开发者所见高度一致:模型仅发出浅层查询,未能深入理解记录内容,对客户沟通极少,且在智能体架构和资源分配上实验不足,直接交付首个可运行的设计。我们希望τ²-bench能将协作式智能体构建工作转化为可量化的评测目标,用于评估编码智能体的能力。
