论文

超越眼睛:通过自我调节的隐式视觉工具进行高效的多模态推理

Beyond the Eye: Efficient Multimodal Reasoning via Self-Regulated Implicit Visual Tools

智能体系统Agent 工具调用

摘要

最近的多模态 大语言模型 (MLLM) 通过迭代执行各种视觉工具操作,在“用图像思考”(TwI) 范式下的细粒度感知任务方面取得了显着进展。然而,这种范例严重依赖于频繁的外部工具调用和重复的图像重新编码,这会导致大量的计算开销和推理延迟。为了解决这些问题,我们提出了Beyond the Eye(BEE),一种以自我调节能力为中心的新型隐式视觉工具范例。 BEE直接将可视化工具调用行为纳入训练目标,并鼓励模型开发自我调节的调用机制。这种设计使模型能够自适应地平衡内部知识和隐式工具,避免冗余工具使用,同时大幅减少推理延迟。具体来说,BEE 涉及两个阶段的训练过程:(1) 形式化思想链 (CoT) 监督 微调 (SFT)。我们使用结构化工具槽和混合调用状态构建 CoT 轨迹。此阶段激活模型的隐式工具表示和自适应切换功能。 (2)自我调节的奖励驱动的协调。为了解决由于认知边界模糊而导致的冗余工具使用问题,我们首先引入净工具增益(NTG)指标来量化这种现象。基于这一观察,我们进一步提出了自我调节的奖励机制。该机制惩罚无效的工具依赖,并鼓励模型进行知识路由,确保仅当模型内部知识不足时才调用隐式工具。 BEE 在细粒度视觉感知方面实现了最先进的性能,同时在一般推理任务中保持竞争力,并在推理效率方面取得了显着的进步。