论文
E-Bench:在真实产品场景中评测多步工具使用智能体
E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios
摘要
大语言模型(LLM)越来越多地被部署为与有状态环境进行多步交互的智能体:收集隐藏信息、组合工具调用并提交状态变更。我们将这一能力称为多步工具使用。现有基准推进了工具使用智能体评估,但往往聚焦于孤立的API调用、短轨迹,或难以扩展与控制的设置。我们提出E-Bench,一个全合成基准,涵盖三个产品领域(王者荣耀、QQ音乐与腾讯会议)的323个改变状态的任务。E-Bench把环境合成与任务合成解耦:图引导的数据库填充构建可复用、无孤儿记录的产品环境,而生成器-求解器不对称性制造出同时存在信息缺口与工具缺口的任务,要求智能体发现隐藏数据并在改变状态之前组合多个工具调用。任务结果由数据库状态差异确定性评分。由于环境与任务均为合成,E-Bench在环境层面可控、在任务层面可扩展。对11个前沿LLM的基准测试表明,多步工具使用仍然具有挑战性:最强模型的Pass^3仍低于60%,即便在E-Bench-Code扩展中引入代码执行,可靠性(Pass^3)仍低于70%。
