论文

SPT:作为代理语言模型的 预训练 数据的技能

SPT: Skills as Pre-Training Data for Agentic Language Models

模型训练预训练

摘要

代理(使用工具)语言模型主要在 后训练 期间对工具调用轨迹和代理轨迹进行训练。这些数据提供直接的行为监督,但生成它们需要任务环境、执行和验证,使得广泛的工具和任务覆盖范围变得昂贵。公开可用的技能提供了训练数据的另一个来源:它们编码可重用的工具语义和工作流程,但通常仅用作推理时间上下文。我们引入了 Skill 预训练 (SPT),这是一种将因果语言建模应用于 SkillCorpus 的中期训练方法,SkillCorpus 是公共多文件技能包的集合,可以选择与一般数据混合。为了保留每个包内文件之间的关系,我们还引入了引用插入,这是一种引用感知汇编策略,可将支持文件放置在主指令中提及的位置附近。跨多个模型规模和 后训练 配方的实验表明,SPT 在一般或轨迹数据的训练中期持续提高代理性能,同时在很大程度上保留一般性能。数据混合实验显示了将技能数据与一般退火语料库相结合的额外好处。这些结果表明技能包是 预训练 代理语言模型的宝贵数据源。