论文

腐败与重建循环的技能训练

Skill Training with Corruption and Reconstruction Loop

智能体系统Agent HarnessAgent Skills

摘要

大语言模型 (LLM) 经常在高度专业化的领域中挣扎。最近提出了外部技能(通常定义为文本文件)来增强专门领域的 LLM,而不是昂贵且难以解释的 LLM 的参数级改编。然而,此类技能依赖于昂贵的主动人工注释或高质量示例的被动总结。在本文中,我们提出了一种用于代理自我进化的自我监督方法,该方法直接从现有的高质量人类工件中学习特定领域的技能,而无需额外的人类注释或外部奖励。受扩散模型的启发,我们的方法遵循前向损失后向过程,通过迭代学习代理的外部技能库而不是更新其模型参数来重建人类工件。短剧剧本创作实验表明,我们的方法使智能体能够从人类创作的剧本中自主提取通用的写作技能,并显着提高特定领域的生成质量。我们的方法为代理提供了一个可扩展的范例,可以从现有的高质量人工制品中不断学习多种复杂的技能。代码和项目页面:https://github.com/skilltraining-project/skill-training 和 https://skilltraining-project.github.io