论文
VTC-Bench:通过组合式视觉工具链评估智能体型多模态模型
VTC-Bench: Evaluating Agentic Multimodal Models via Compositional Visual Tool Chaining
摘要
近期的进展使多模态大语言模型(MLLM)超越标准视觉问答,开始利用外部工具完成高级视觉任务。尽管有这些进展,为复杂任务精确执行并有效组合多样工具仍是持续存在的瓶颈。受限于稀疏的工具集与简单的工具使用轨迹,现有基准无法捕捉复杂多样的工具交互,难以在贴近实际的现实条件下评估模型性能。为弥合这一差距,我们提出VisualToolChain-Bench(VTC-Bench),一个旨在评估MLLM工具使用熟练度的综合基准。为与真实的计算机视觉流水线对齐,我们的框架提供32种基于OpenCV的多样视觉操作。这一丰富的工具集支持大量组合,使VTC-Bench能够严格评估多工具组合与长程多步骤计划执行。为实现精确评估,我们提供680道精心整理的问题,按九类认知层级组织,每题均带有真值执行轨迹。在19个领先MLLM上的大量实验揭示了当前模型视觉智能体能力的关键局限。具体而言,模型难以适应多样工具集并泛化到未见过的操作,最领先的模型Gemini-3.0-Pro在该基准上也仅达到51%。此外,多工具组合仍是一个持续存在的挑战。面对复杂任务时,模型难以制定高效的执行计划,严重依赖熟悉功能中狭窄且次优的子集,而非选择最优工具。通过识别这些根本性挑战,VTC-Bench建立了一个严格基线,以指导更具泛化能力的视觉智能体模型的开发。
