论文

通过多模态推理中的免训练经验复用,从工具使用者进化为工具创造者

Evolving from Tool User to Creator via Training-Free Experience Reuse in Multimodal Reasoning

智能体系统上下文与知识记忆Agent 工具调用Agent记忆

摘要

现有的工具集成推理(TIR)模型通过引入外部工具,有效扩展了 LLM 的问答能力。然而,现实场景中存在大量开放式问题,固定工具往往无法满足任务要求。此外,缺乏自我优化机制意味着错误的工具输出可能误导 LLM 的回答。另外,现有工具的构建需要大量人工投入,从而限制了其适用性。认识到 LLM 的推理轨迹蕴含隐式的问题解决能力,我们提出 UCT,一个将智能体从工具使用者转变为工具创造者的免训练新框架。该方法收获推理经验并将其提炼为可复用资产。这一方法使智能体从单纯的工具使用者转变为工具创造者,能够在推理过程中进行自适应工具创建与自我更新。我们还引入记忆巩固机制来维护工具库,确保所保留经验记忆对后续推理任务的高复用性。这一新型自动化工具构建范式在推理过程中持续提升工具质量,使整个智能体系统无需额外训练即可进步。大量实验表明,我们的方法为增强 TIR 模型能力提供了一种新范式。特别是,在跨多领域的数学与科学推理任务基准上取得 +20.86% 与 +23.04% 的显著性能提升,验证了智能体的自我进化能力。

通过多模态推理中的免训练经验复用,从工具使用者进化为工具创造者
图2:所提出的自进化智能体框架的总体架构。系统通过三个耦合阶段运行:(1)在线任务循环使用 ReAct 范式管理问题求解过程。在步骤 t,策略模型 \pi_{\theta} 基于交互历史 h_{t} 和当前观测 o_{t} 预测最优动作 a_{t+1}=\operatorname*{arg\,max}P_{\theta}(a\mid h_{t},o_{t},\mathcal{T})。动作空间 \mathcal{A} 动态整合推理思考、工具执行(\mathcal{T}_{\text{core}}\cup\mathcal{T}_{\text{cre}})以及工具创建请求。(2)在线构建循环由创建工单 \mathbf{c}_{\text{ticket}} 触发,以迭代地合成新工具代码。这一隔离的精炼过程形式化为 C^{(k)}=\Psi_{\text{build}}(C^{(k-1)},\mathcal{R}_{\text{critic}},\mathcal{R}_{\text{sandbox}}),其中生成器通过融合评论模型(\mathcal{R}_{\text{critic}})和沙箱执行环境(\mathcal{R}_{\text{sandbox}})的反馈来优化代码 C^{(k)}。(3)离线记忆巩固模块异步演化工具库,通过合并、分类和剪枝工具资产,确保长期可扩展性与检索效率。