论文

ToolSelf:通过工具驱动的内在适应来统一任务执行和自重新配置

ToolSelf: Unifying Task Execution and Self-Reconfiguration via Tool-Driven Intrinsic Adaptation

智能体系统模型训练强化学习Agent 架构与控制循环Agentic RL

摘要

由大语言模型 (LLM) 支持的代理系统在处理复杂的长期任务方面表现出了巨大的潜力。然而,它们的功效从根本上受到管理代理行为的静态配置的限制,这些配置在执行之前是固定的,无法适应不断变化的任务动态。现有的方法依赖于手动编排或基于启发式的补丁,通常会遇到泛化能力差和优化碎片化的问题。为了超越这些限制,我们提出了 ToolSelf,这是一种支持工具驱动的运行时自我重新配置的新颖范例。 ToolSelf通过将配置更新抽象为可调用工具,将任务执行和自我调整统一到单个动作空间中,实现从外部规则到内在参数的阶段过渡。因此,智能体可以根据任务进展自主更新其子目标和上下文,并相应地调整其策略和工具箱,从被动执行者转变为任务和自我的双重管理者。我们进一步设计了配置感知两阶段训练(CAT),将拒绝采样微调与轨迹级强化学习相结合,以内化这种元能力。跨不同基准的大量实验表明,ToolSelf 可以与专门的工作流程相媲美,同时可以推广到新颖的任务,实现了 24.1% 的平均性能增益,并照亮了一条通往真正自适应代理的道路。

ToolSelf:通过工具驱动的涌现式适应统一任务执行与自重构
图1:ToolSelf 示意图。(a) 多智能体工作流依赖人工先验,泛化能力差;(b) 单智能体扩展通过外部启发式机制打上碎片化的补丁;(c) ToolSelf 将任务执行与自重构统一到单一动作空间中,实现内在且可学习的适应。(d) 系统通过推理-重构循环运行。在每一阶段 i,推理智能体 π_i 在动态配置 𝒞_i=(q_i,σ_i,T_i,K_i) 下执行任务,该配置包括子目标、策略、工具箱与上下文。当智能体判定需要重构时,它会调用重构工具 T_reconfig,进而触发重构引擎 μ 生成供下一阶段使用的更新配置 𝒞_{i+1}。通过将任务执行与自配置统一到单一动作空间,ToolSelf 实现了自主触发(决定何时)、意图驱动的适应(指定如何)与联合优化(端到端学习),从而将智能体从被动执行者转变为任务与自配置的双重管理者。