论文
WorkSurface-Bench:在多表面知识路由上对企业代理进行基准测试
WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing
摘要
企业代理通常需要集成异构知识源:用于叙述事实的文档、用于计算的表格以及用于文件关系的依赖图。现有的基准通常评估检索或工具的使用,而不区分代理是否首先选择适当的知识源。我们引入了 WorkSurface-Bench,这是一个评估表面布线功能的基准。它包含 1,151 个原子任务,这些任务源自角色范围的 Workspace-Bench-Lite 工作区,涵盖文档、表格、图形和跨表面问题。其参考答案是可审计的:表答案通过执行的 DuckDB 查询重现,文档答案基于经过验证的文本范围,图形答案可追溯到源依赖注释。我们评估了 6 个受控代理设置中的 4 个模型主干,产生 27,624 个无协议错误的轨迹。在金约束工具访问下,代理实现了 98.7-99.8 路线 F1,而答案仍仅为 56.1-75.3%,这表明正确的表面选择是必要的,但不足以完成任务。匹配的干预进一步表明,表面提示提高了四个模型中三个模型的答案,而删除不相关的工具主要提高了路由和效率。在由三名注释者组成的独立审核中,所有 200 个抽样任务以多数票通过了所有六项质量标准,其中 192 个任务在每项标准上都获得了一致判断。我们在 https://github.com/haolpku/WorkSurface-Bench 发布了数据集、构建管道、评分代码和代理工具。