论文

画出你所见:评测多模态智能体中的灵巧视觉工具使用

Paint What You See: Benchmarking Dexterous Visual Tool Use in Multimodal Agents

智能体系统Agent任务评测

摘要

评估正从静态问答转向模型借助外部工具行动的Agentic场景。我们识别出该领域一项关键但研究不足的能力——灵巧视觉工具使用:细粒度、闭环的参数化视觉动作,模型从视觉证据推断工具参数,而这些参数直接决定最终结果。现有基准覆盖网页导航、GUI操作与软件工程,但很少针对视觉证据与执行精度之间的这种耦合。我们提出EASEL基准,评估灵巧视觉工具使用的一个受控实例,其主代理任务为参考图引导的视觉重建:智能体逐步在画布上作画以匹配参考图像。EASEL还包含涵盖区域标注、手写与路径规划的语义任务。我们进一步提供EASEL-Data——一个44万样本、两阶段课程式、面向轨迹监督的数据集——以及EASEL-9B,用以考察其对这一能力的影响。对25个模型的评测显示,当前多模态智能体在EASEL上普遍表现不佳。重建相似度停留在低水平(0.40-0.54),轨迹诊断则暴露出严重的闭环不稳定性——模型通常早期即饱和或在峰值后退化。语义任务揭示了精确标注与路径规划上的明显能力边界。在EASEL-Data上训练的EASEL-9B较基座模型相对提升6.3%,在所有受评模型中排名第三。

画出你所见:评测多模态智能体中的灵巧视觉工具使用:论文配图
图1:视觉任务执行的方法路径。现有范式各自回避精确执行——通过容差余量、仅理解式操作,或委托给外部模型。EASEL 要求智能体通过闭环细化直接产生参数化动作。