论文

SpecEyes:通过推测性感知和规划加速代理多模式 LLM

SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning

模型推理投机采样

摘要

Agentic 多模态 大语言模型 (MLLM)(例如 OpenAI o3 和 Gemini Agentic Vision)通过迭代视觉工具调用实现卓越的推理能力。然而,级联的感知、推理和工具调用循环会带来显着的顺序开销。这种开销(称为代理深度)会导致令人望而却步的延迟,并严重限制系统级并发性。为此,我们提出了 SpecEyes,这是一个代理级推测加速框架,可以打破这个顺序瓶颈。我们的主要见解是,轻量级、免工具的 MLLM 可以作为推测性规划器来预测执行轨迹,从而能够在不牺牲准确性的情况下提前终止昂贵的工具链。为了规范这种推测性规划,我们引入了一种基于答案可分离性的认知门控机制,该机制可以量化模型自我验证的置信度,而无需预言机标签。此外,我们设计了一个异构并行漏斗,利用小模型的无状态并发来掩盖大模型的有状态串行执行,从而最大化系统吞吐量。在 V* Bench、HR-Bench 和 POPE 上进行的大量实验表明,SpecEyes 比代理基线实现了 1.1-3.35 倍的加速,同时保持甚至提高了准确性(高达 +6.7%),从而提高了并发工作负载下的服务吞吐量。