论文

LLM 中持续工具使用学习的轨迹监督

Trajectory Supervision for Continual Tool-Use Learning in LLMs

模型训练持续学习

摘要

大多数语言-模型训练 数据显示最终工件,而不是生成它们的过程。我们在工具使用中研究了这个问题的一个易于处理的版本:当模型学习一系列新的 API 域时,与剥离中间 API 跟踪相比,保留工具使用轨迹是否有帮助?我们使用四个连续域块在 API-Bank 上通过 QLoRA 微调 Llama 3.1 8B Instruct。条件 A 从提示中剥离之前的 API 请求/响应行,并训练模型来预测下一个 API 调用。条件 B 保留轨迹上下文。在单种子试验中,完整的保留生成评估显示,条件 B 的最终精确完整调用准确率达到 56.9%,而条件 A 的准确率仅为 39.2%。B 还将最终 API 名称准确度提高了 7.7 个百分点。然而,B 使用了 25.1% 以上的训练标记,运行使用一个种子,并且任务是下一次调用预测而不是完整的对话成功。