论文
SkillHEX:通过假设驱动的自主探索与利用改善Agent技能
SkillHEX: Improving Agent Skills via Hypothesis-Driven Autonomous Exploration and Exploitation
摘要
尽管代理技能使LLMs具备可重用的程序化知识,手动维护却面临高昂成本、不扩展性和偏差问题。因此,在实际部署中,需要在测试时间进行自主、按需技能进化,受限于有限的交互预算和缺乏训练或验证集。这种设置引入了严重的稀疏奖励挑战,结果会混合多种潜在失败原因。在这种模糊性下,贪婪地细化单一 incumbents技能的方法特别容易陷入过度利用陷阱,允许早期诊断错误消耗了有限的试验次数在无效路径上。为解决这一问题,我们提出SkillHEX,这是一种闭环框架,结合假设驱动的自我验证与证据引导的树搜索。SkillHEX将不可证实的失败假设转化为可执行测试,产生密集奖励作为替代环境尝试。这种证据指导搜索持续技能修订分支,动态平衡支持编辑的过度利用与探索可能替代品的适度探索。在SkillsBench上的87个任务上进行评估,SkillHEX优于现有自进化方法,并在使用GPT-5.3-Codex和Claude Opus 4.7时分别达到平均通过率55.9%和57.9%。
