论文

SkillHone:通过持久决策历史记录持续座席技能进化的工具

SkillHone: A Harness for Continual Agent Skill Evolution Through Persistent Decision History

智能体系统Agent Harness

摘要

代理技能通过特定于任务的过程、脚本和参考来扩展语言模型代理,但它们所针对的任务和环境不断变化。现有的方法提高了有界运行中的技能,并且仅保留最终的工件,丢弃了后来的代理需要解释先前的修订、评估和拒绝的替代方案的决策历史记录。我们推出了 SkillHone,这是一种基于持久决策历史记录的持续座席技能进化工具。 SkillHone 将技能修订与评估方面的证据相结合,提供实践反馈,记录诊断、修订、证据和结果的结构化历史。角色分离的子代理通过经过编辑的报告在实践探索中运行候选人技能,并根据先前的决策提出修订建议,从而实现跨会话细化,而无需重新发现过去的理由。在深度研究基准测试中,SkillHone 在没有预集成搜索堆栈的情况下运行,并且在 GAIA 上比商业支持的深度研究代理高出 15.8 分,在 WebWalkerQA-EN 上高出 3.2 分,同时也超过了之前的技能进化方法。我们进一步在内部工具介导的分析场景中部署 SkillHone,它在 7 种设置中平均提高了 18.8 分的准确性。