论文

重新思考自我进化代理技能:多轮反馈动态

Rethinking Self-Evolving Agent Skills: Feedback Dynamics over Multiple Rounds

智能体系统Agent任务评测Agent Skills

摘要

自我进化的技能系统有望通过将执行反馈转化为持久的技能更新来改进代理,而无需更改底层模型。然而,目前尚不清楚进一步的进化何时会有所帮助,成功和失败的轨迹如何影响修正,以及额外的测试时间计算是否可以恢复相同的收益。为了解决这些问题,我们提出了一个涵盖五个基准和三个模型的受控评估框架。我们的主要研究包含 14 个支持的模型基准设置中的 42 个反馈运行。在每个设置中,我们保持执行器和优化器配置、修订程序、验证规则和回合预算固定,同时仅改变向优化器显示的反馈:成功和失败(正常)、仅失败或仅成功。进化是稀疏的:388 个候选者中只有 55 个建立了字节不同的验证最佳值。基于验证的选择在 14 种设置中的 11 种中选择进化技能,其中 9 种提高了发布测试的性能。所有 11 个选择都来自包括失败轨迹的反馈条件,尽管“正常”和“仅失败”的相对排名因设置而异。对测试、鲁棒性和迁移的验证和下游评估有时会偏向不同的反馈观点。涵盖八个模型的更广泛的 SearchQA 分析显示出类似的稀疏、依赖反馈的动态。在 GPT-5.5 测试时间缩放控制中,oracle 并行采样与改进的 SearchQA 技能相差 0.43 分,但在 SpreadsheetBench 上仍落后 30.96 分;顺序细化无法恢复这两种增益。总体而言,持久技能自我进化可以更好地理解为稀疏的、经过验证过滤的搜索,具有依赖于模型和基准的回报,而不是通过额外轮次的稳定改进。该实施可在 https://github.com/HKUST-KnowComp/rethinkskill 获取。