论文

TeamBench:在强制角色分离下评估智能体协调

TeamBench: Evaluating Agent Coordination under Enforced Role Separation

智能体系统AI 基础设施Agent任务评测SandboxAgent Sandbox

摘要

代理系统通常将任务分解为多个角色,但这些角色通常由提示指定,而不是由访问控制强制执行。如果没有强制执行,团队通过率可能会掩盖代理是否真正协调或一个角色是否有效地完成了另一个角色的工作。我们推出了 TeamBench,这是一个包含 851 个任务模板和 931 个种子实例的基准测试,用于评估操作系统强制角色分离下的代理协调。 TeamBench 将规划者、执行者和验证者角色之间的规范访问、工作区编辑和最终认证分开,因此任何角色都无法读取完整的需求、修改工作区并验证最终答案。仅提示和沙盒执行的团队在统计上达到了无法区分的通过率,但仅提示运行会导致验证者尝试编辑执行器代码的情况增加 3.6 倍。验证者批准了 49% 未通过确定性评分者的提交,并且删除验证者可以提高消融中的平均部分分数。团队价值也是有条件的。当单个特工陷入困境时,团队会受益,但当单个特工已经表现良好时,团队就会受到伤害。在相同角色分离下进行的 40 次人体研究表明,我们的基准暴露了通过率遗漏的交互模式。单独的参与者直接完成任务,与代理配对的人类参与者通常会陷入快速批准,而人类团队则花费更多的精力来协调跨角色的缺失信息。

TeamBench:在强制角色分离下评估智能体协调:论文配图
图 1:TeamBench 在强制角色分离下评估代理。规划者读取完整的需求,执行者编辑工作空间,验证者发布最终裁决。沙箱限制每个角色可以读取或写入哪些文件。该示例显示了角色失败,其中验证程序接受了违反规划器约束的实现。