论文

MindWatcher:迈向更聪明的多模态工具集成推理

MindWatcher: Toward Smarter Multimodal Tool-Integrated Reasoning

智能体系统模型训练强化学习Agent 工具调用Agentic RL

摘要

传统基于工作流的Agent在解决需要工具调用的现实问题时智能有限。能够自主推理与调用工具的工具集成推理(TIR)Agent正在迅速兴起,成为处理需与外部环境多步交互的复杂决策任务的强大方法。在这项工作中,我们提出MindWatcher,一个集成交错思考与多模态思维链(CoT)推理的TIR Agent。MindWatcher可以自主决定是否调用以及如何调用多种工具并协调其使用,而不依赖人工提示或工作流。交错思考范式使模型能在任一中间阶段于思考与工具调用之间切换,其多模态CoT能力允许在推理过程中操作图像以获得更精确的搜索结果。我们实现了自动化数据审计与评估流水线,辅以人工整理的高质量训练数据集,并构建了名为MindWatcher-Evaluate Bench(MWE-Bench)的基准来评估其性能。MindWatcher配备了一整套辅助推理工具,使其能够处理广域多模态问题。一个覆盖汽车、动物、植物等八个类别的大规模高质量本地图像检索数据库,使该模型虽体积不大却具备稳健的目标识别能力。最后,我们为MindWatcher设计了更高效的训练基础设施,提升训练速度与硬件利用率。实验不仅表明MindWatcher凭借更优的工具调用匹敌或超越更大或更新的模型,还揭示了Agent训练方面的关键洞见,例如agentic RL中的“遗传继承”(genetic inheritance)现象。

MindWatcher:迈向更聪明的多模态工具集成推理 配图
图1:MindWatcher在MWE-Bench上的性能。