论文
MM-ToolSandBox:评估可视化工具调用代理的统一框架
MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents
摘要
我们引入了 MM-ToolSandBox,这是一个针对基于视觉的工具调用代理的基准和评估框架。该框架提供了一个跨越 16 个应用领域的 500 多个工具的有状态执行环境,支持多图像、多回合任务,其中代理必须将逐渐到达的视觉输入转化为可执行工具调用,同时处理现实的对话现象(目标修改、错误更正、状态突变)。自动场景生成管道通过信息流引导的规划和多阶段质量过滤来生成多样化的、基于视觉的场景,从而产生 258 个经过人工验证的标称场景和 50 个针对交互式 UI 应用程序的变体。对从 4B 开放权重到前沿专有系统的 12 个最先进模型进行评估表明,当前模型仍然缺乏强大的视觉工具调用能力:即使是最好的模型也达到了 50% 以下的成功率。我们的故障分析进一步表明,视觉精度(而不仅仅是规划)是有能力的模型的主要瓶颈:53%的故障源于从图像中提取错误的信息,尽管任务工作流程是正确的。随着规模的扩大,规划到精确的交叉出现了:较小的模型无法决定要做什么,而较大的模型则无法感知它们所看到的内容,这表明在不同能力水平上改进模型的根本不同的研究方向。该框架和基准可在 https://github.com/apple/ml-mmtoolsandbox 上公开获取