论文
Search2Skill:通过评分量规强化学习实现跨知识边界的技能蒸馏
Search2Skill: Skill Distillation Beyond Knowledge Boundaries Via Rubric-Based Reinforcement Learning
摘要
可重用技能,封装解决实际专业任务所需的操作性知识,为基于语言模型的智能体提供自我进化于专家领域的路径。现有的自适应技能方法通过内部构造技能来实现,这些方法受模型参数化知识或轨迹的限制,因此受限于模型已知的信息。然而,专业技能背后的领域规范和标准流程往往超出这一边界,并且难以从智能体自身中获取。为解决这个问题,我们提出了一种新的框架——搜索到技能(Search2Skill),该框架自动识别智能体的能力差距,从外部资源中解决问题,并将检索到的证据提炼成结构化、可重用的技能。具体而言,Search2Skill通过基于规则的强化学习方案优化,同时提升搜索时机、搜索方式和生成技能的方式。在三个基准数据集上的八项专家级领域实验表明,Search2Skill 在流式和保留测试协议下均优于结合搜索和轨迹导向技能学习基线。进一步分析显示,技能抽象而非原始检索证据的改进是主要原因,而获取到的技能能够在不同模型规模上进行迁移。
