论文

技能还是跳过?通过双粒度偏好学习学习代理任务中的选择性技能调用

Skill or Skip? Learning Selective Skill Invocation in Agentic Tasks via Dual-Granularity Preference Learning

模型训练偏好优化

摘要

代理技能是可调用的程序模块,为复杂的代理任务提供可重用的知识和执行策略。然而,现有的方法主要侧重于选择相关技能或提高技能本身,而忽略了在当前决策点是否应该实际调用相关技能。无用的调用可能会引入不相关的上下文并破坏原本正确的执行过程。为了解决这个问题,我们提出了 SelSkill,一种用于选择性技能调用的双粒度偏好学习框架。 SelSkill 将技能使用制定为“技能或跳过”决策,使用预测不确定性来确定候选决策点的优先级,并从共享轨迹前缀构建受控的调用​​-跳过偏好对。它进一步将情节级结果偏好与步骤级调用偏好结合起来,以捕获整体轨迹质量和技能调用的局部有效性。在使用 Qwen3-8B 的 ALFWorld 上,SelSkill 的任务成功率比启用技能的基线提高了 10.9 点,比无技能的基线提高了 7.8 点,执行精度提高了 29.1 点。在 BFCL 上,任务成功率和执行精度分别提高了 5.7 点和 29.5 点。 Tau-bench 和 PopQA 上的零样本结果表明部分转移到了未知的领域和技能。