论文
EvoTool:通过归因感知变异与多样性感知选择实现LLM Agent工具使用策略的自进化优化
EvoTool: Self-Evolving Tool-Use Policy Optimization in LLM Agents via Blame-Aware Mutation and Diversity-Aware Selection
摘要
基于LLM的Agent依赖有效的工具使用策略来解决复杂任务,但由于长程轨迹中的延迟监督和贡献归因难题,优化这些策略仍然充满挑战。现有优化方法要么是整体式的,容易使行为纠缠在一起;要么是单方面的,忽略跨模块的错误传播。为解决这些局限,我们提出EvoTool,一个通过免梯度进化范式优化模块化工具使用策略的自进化框架。EvoTool将Agent的工具使用策略分解为Planner、Selector、Caller和Synthesizer四个模块,并在自我改进循环中通过三种新机制迭代改进它们:Trajectory-Grounded Blame Attribution利用诊断轨迹将失败定位到特定模块;Feedback-Guided Targeted Mutation随后通过自然语言批评仅编辑该模块;Diversity-Aware Population Selection保留互补候选以确保解的多样性。在四个基准上,EvoTool在GPT-4.1和Qwen3-8B上都比强基线高出5分以上,同时展现出更优的效率和可迁移性。代码将在论文被接收后发布。
