论文

Branch2Skill:通过推理树实现高效技能演化

Branch2Skill: Efficient Skill Evolution Through Reasoning Trees

智能体系统Agent Skills

摘要

技能演化通过反馈随时间改进智能体技能,失败轨迹常通过暴露不完整或误导性行为提供有信息量的信号。然而现有方法主要依赖单条轨迹,早期推理错误会在后续步骤中传播,削弱可用于技能改进的反馈。因此改进技能需要反复进行回放、诊断与更新循环,产生大量token成本。为应对这一挑战,我们提出Branch2Skill,一个将单棵推理树转化为技能演化稠密监督的高效框架。对每个任务或问题,Branch2Skill在固定预算下进行蒙特卡洛树搜索以获得多样推理轨迹,然后将精英路径与共享相同前缀的兄弟备选比较,提取分步证据,指明哪些推理模式应保留、修改或避免。最后,Branch2Skill把多步证据蒸馏为可复用的更新,使一棵推理树能跨多个推理步骤提供监督,减少重复的回放-更新循环。在覆盖推理与agentic任务的六个基准上,Branch2Skill持续提升任务性能并提高技能演化效率。例如,以GPT 5.5为目标模型时,Branch2Skill比SkillOpt少用73.2%的token,同时取得更优性能。这些结果表明,推理树不仅能支持更有效的轨迹搜索,还能提供更丰富的监督以实现更高效的技能改进。代码将发布。

Branch2Skill:通过推理树实现高效技能演化:论文配图
图1:推理树提供密集证据。左:一次失败的rollout往往只能产生一个可靠的更新信号,因为后续步骤会继承第一个关键错误。因此,提取另一个信号需要新一轮生成与更新。右:Branch2Skill在多个深度上将每个被选中的步骤与共享相同前缀的兄弟备选步骤进行比较。这些局部比较使单个搜索树能够产生多个技能更新信号。