论文
通过似然引导工具空间优化的自我进化Agent
Self-Evolving Agents via Likelihood-Guided Tool-Space Optimization
摘要
自我进化的智能体可以不断改进它们的行为,而工具则定义了它们与环境交互的可执行动作空间。然而,将完整的工具库暴露给模型会引入大量不相关的上下文,并可能损害工具使用决策。我们研究工具空间的自我演化,其中每个重复任务类型都维护一个持久的工具空间,该空间是根据累积的输出经验构建的。我们确定了现有方法的三个局限性:(1)输出无意识选择:它们主要依赖于工具描述或模型先验,而不是观察到的工具输出; (2)跨请求的无状态性:他们为每个请求独立选择工具,而不将先前的输出经验整合到持久的特定于任务的状态中; (3) 推理成本:他们针对同一任务的后续请求重复搜索、排名或推理候选工具。我们通过输出感知工具评分、持久的特定于任务的工具空间、摊销工具选择和跨模型的可重用配置来解决这些限制。我们引入了 LOTS(仅似然工具评分),它在保持模型参数固定的同时,根据积累的输出经验发展Agent的工具空间。在每次请求之后,LOTS 都会保留模型生成的答案,并通过测量当观察到的输出被删除时答案可能性的变化量来估计每个工具的贡献。这些贡献在每个重复任务中聚合,以对工具进行排名并更新其持久空间。在三个基准测试中,LOTS 提高了任务性能,同时大幅减少了工具上下文。更重要的是,顺序实验表明,特定任务的空间会随着时间的推移持续存在并持续改进,而跨模型实验表明,学习到的配置可以在不同模型之间转移。