论文
TOBench:面向真实世界工具使用代理的任务导向全模态基准
TOBench: A Task-Oriented Omni-Modal Benchmark for Real-World Tool-Using Agents
摘要
人们日益期望工具使用代理能在真实职业工作流中运作:它们必须解读多模态输入、协调外部工具、检查中间产物,并在产出最终结果前修正自身动作。然而,现有基准往往孤立地评估工具使用、计算机使用和多模态推理,使基准设置与真实世界的端到端全模态工具使用之间存在空档。为弥合这一空档,我们提出MM-ToolBench,一个面向任务导向全模态工具使用的基准与评估工具集。MM-ToolBench包含来自客户服务与智能创作两大任务族的100个可执行任务,覆盖20个子类切片,由27个MCP服务器和324个工具支撑。MM-ToolBench的核心设计是闭环多模态验证:代理必须执行工具、检查渲染或转换后的产物,并在输出不满足任务特定要求时自我纠错。为使此类评估可扩展且可验证,MM-ToolBench将基于MCP的执行与任务特定的落地评估器相结合,并配有覆盖场景发现、任务实例化、评估器合成与人工审计的半自动构建流水线。在15个当代代理模型上的实验显示,MM-ToolBench仍极具挑战性:通常被视为最强编码代理模型之一的Claude Opus 4.6仅取得32.0%的任务成功率,远低于94.0%的人类水平。我们期望MM-ToolBench成为通过闭环多模态验证来评估并推进下一代全模态工具使用代理的实用基础。
