论文
Agentic-MME:智能体能力究竟能为多模态智能带来什么?
Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?
摘要
多模态大语言模型(MLLM)正从被动观察者演化为主动智能体,通过视觉扩展(Visual Expansion,调用视觉工具)与知识扩展(Knowledge Expansion,开放网络搜索)来解决问题。然而,现有评估存在不足:它们缺乏灵活的工具集成,将视觉工具与搜索工具分开测试,且主要以最终答案进行评估。因此,它们无法验证工具是否被真正调用、正确使用或高效利用。为解决这一问题,我们提出Agentic-MME,一个面向多模态智能体能力的过程验证基准。它包含覆盖6个领域、3个难度级别的418个真实世界任务以评估能力协同,配有2000多个逐步检查点,每个任务平均需要10人时以上的人工标注。每个任务包含一个支持沙箱化代码与API的统一评估框架,以及一条沿S轴与V轴双轴标注逐步检查点的人类参考轨迹。为实现真正的过程级验证,我们审计细粒度的中间状态而非仅看最终答案,并通过相对人类轨迹的过度思考(overthinking)指标量化效率。实验结果显示,最佳模型Gemini3-pro取得56.3%的总体准确率,而在Level-3任务上骤降至23.0%,凸显了真实世界多模态智能体问题求解的难度。
