论文
通过多模态推理中的免训练经验复用,从工具使用者进化为工具创造者
Evolving from Tool User to Creator via Training-Free Experience Reuse in Multimodal Reasoning
摘要
现有的工具集成推理(TIR)模型通过引入外部工具,有效扩展了 LLM 的问答能力。然而,现实场景中存在大量开放式问题,固定工具往往无法满足任务要求。此外,缺乏自我优化机制意味着错误的工具输出可能误导 LLM 的回答。另外,现有工具的构建需要大量人工投入,从而限制了其适用性。认识到 LLM 的推理轨迹蕴含隐式的问题解决能力,我们提出 UCT,一个将智能体从工具使用者转变为工具创造者的免训练新框架。该方法收获推理经验并将其提炼为可复用资产。这一方法使智能体从单纯的工具使用者转变为工具创造者,能够在推理过程中进行自适应工具创建与自我更新。我们还引入记忆巩固机制来维护工具库,确保所保留经验记忆对后续推理任务的高复用性。这一新型自动化工具构建范式在推理过程中持续提升工具质量,使整个智能体系统无需额外训练即可进步。大量实验表明,我们的方法为增强 TIR 模型能力提供了一种新范式。特别是,在跨多领域的数学与科学推理任务基准上取得 +20.86% 与 +23.04% 的显著性能提升,验证了智能体的自我进化能力。
