论文

MUSE:MLLM 的统一代理工具

MUSE: A Unified Agentic Harness for MLLMs

智能体系统Agent Harness

摘要

尽管取得了快速进展,但多模态 大语言模型 (MLLM) 在人类轻松解决的任务上仍然失败,例如从屏幕截图中导航网格迷宫或选择正确的拼图。我们不是重新训练模型,而是提出一个补充问题:纯粹通过改进周围的执行支架,可以从冻结的 MLLM 中获得多少能力?我们推出了 MUSE,一种多模态统一结构化执行工具,它将任何现成的 MLLM 与可组合模块包装在一起,用于任务表示、视觉处理、感知工具使用、结构化解析、确定性验证和验证者引导修复,无需任何模型重新训练。我们使用多个最先进的 MLLM,在视觉空间规划、视觉感知、多模态推理和细粒度视觉辨别等不同基准上评估 MUSE。 MUSE 在所有设置中都比裸模型提供一致的增益,在具有挑战性的实例中跳跃最大。进一步的分析表明,许多 MLLM 故障是由Harness级缺陷而不是基本模型缺陷引起的,并且可以通过验证者引导的修复来解决,而无需触及模型。这些发现强调了代理多模态利用是一个关键但尚未充分探索的设计维度,为改进 MLLM 提供了超越以模型为中心的优化的正交途径。