论文
通过 QLoRA 微调 在小语言模型中内化工具知识
Internalizing Tool Knowledge in Small Language Models via QLoRA Fine-Tuning
摘要
大语言模型 越来越多地用作代理系统中的规划组件,但当前的工具使用管道通常需要在每个提示中包含完整的工具模式,从而产生大量的词元开销并限制较小模型的实用性。本文研究了工具使用知识是否可以通过参数高效的 微调 内化到小型语言模型中,从而在推理时无需明确的工具描述即可实现结构化规划。我们使用 AssetOpsBench 作为主要基准,通过 8 位 QLoRA 对涵盖工具知识、问题到计划映射和执行风格跟踪的大约 1,700 个工具使用示例进行微调。我们在无描述推理下评估生成的模型,其中提示完全省略了工具目录。经过微调的模型优于接收完整工具描述的知情未微调基线,将输入长度减少了 82.6%,同时提高了结构和 LLM 判断计划分数。在最佳 Gemma 运行中,该模型的 AT-F1 为 0.65,总体评判得分为 3.88,而知情基线的得分为 0.47 和 2.88。 Qwen3-4B 获得了 3.78 的强劲总体评判分数,同时使用的内存比 Gemma 少 62%,运行速度比 Gemma 快 2.5$\times$,尽管它在一般多项选择基准测试中也表现出更大的灾难性遗忘。额外的消融表明,LoRA 等级控制着质量与保留的权衡,$r=32$ 最大化了规划质量,较小的等级保留了更多的一般知识。这些结果表明,对于固定工具目录,QLoRA 微调 可以将工具知识从提示上下文转移到模型权重中,从而显着减少推理开销,同时保持或提高工具规划质量。