论文
FT-Dojo:迈向用语言智能体自主微调 LLM
FT-Dojo: Towards Autonomous LLM Fine-Tuning with Language Agents
摘要
为垂直领域微调大语言模型仍然是一个劳动密集型且昂贵的过程,需要领域专家整理数据、配置培训并迭代诊断模型行为。尽管人们对自主机器学习的兴趣日益浓厚,但之前的工作还没有解决与代理的端到端 LLM 微调问题。基于大语言模型的代理可以自动化完成整个过程吗?我们将其视为一个实质上开放的问题:智能体必须在一个开放式搜索空间中导航,涵盖来自不同数据源的数据管理、使用复杂的工具进行处理、构建训练管道,并根据快速增长的日志中的评估结果迭代地完善其方法——总体场景比现有基准复杂得多。为了研究这个问题,我们引入了 FT-Dojo,这是一个交互式环境,包含跨 5 个领域的 13 项任务。我们进一步开发 FT-Agent,这是一个反映人类专家的自主系统,通过利用评估驱动的反馈来迭代诊断故障并完善微调策略。 FT-Dojo 上的实验表明,专用微调代理的性能显着优于通用替代品,FT-Agent 在所有五个领域的 13 项任务中的 10 项中实现了最佳性能。消融表明,该方法可以有效地推广到 3B 模型,并对数据扩展权衡和骨干网敏感性提供更多见解。案例分析表明,智能体可以通过从历史经验中累积学习来从失败中恢复,同时也暴露了因果推理的基本局限性——强调了自主大语言模型微调的前景和当前边界。
