论文

SkillReason:面向隐式用户请求的推理增强Agent技能检索

SkillReason: Reasoning-Enhanced Agent Skill Retrieval for Implicit User Requests

模型训练智能体系统强化学习Agent SkillsRLVRAgentic RL

摘要

大语言模型智能体日益依赖可复用技能,将能力扩展到参数化知识之外。然而,从大规模技能库中检索合适技能仍有挑战,因为真实的用户请求往往简短且欠明确,只陈述任务目标,而把所需能力与执行步骤隐去。现有基准对此类请求覆盖有限。为弥补这一空白,我们提出SkillReason-Bench,一个大规模跨领域基准,包含3,729条查询与覆盖九个领域的61,228项技能检索语料。我们进一步提出SkillReason,一个以思维链推理作为技能检索训练时监督的两阶段框架。第一阶段,由更强教师生成的能力推理轨迹通过对比学习、检索分布对齐和语言建模提供显式监督,促使检索器在其查询表示中内化能力推理。第二阶段,检索引导的GRPO目标鼓励模型探索更适合自身能力且对检索更有效的推理轨迹。在推理时,SkillReason直接编码原始查询而无需自回归生成思维链,保持仅查询的高效检索。在SkillReason-Bench、SkillRet和SRA-Bench上的大量实验表明,SkillReason在三个基准上均达到最先进性能,证明推理增强训练能更好地弥合高层任务目标与技能能力之间的语义鸿沟。

SkillReason:面向隐式用户请求的推理增强Agent技能检索:论文配图
图1:从隐式用户请求进行技能检索的示意。传统检索器可能选择表面上相关的技能,而SkillReason则推断底层能力需求以检索合适的技能。