论文
通过两阶段 蒸馏 构建多任务代理 LLM
Building Multi-Task Agentic LLMs via Two-Phase Distillation
摘要
通用人工智能的关键一步是训练可以执行多项任务的模型。在本文中,我们研究如何构建此类模型,首先针对各个任务训练单独的 RL 专家,然后通过 蒸馏 对其进行整合,作为直接在混合任务上训练单个模型的替代方案。我们表明,由于前向 KL 的模式覆盖性质,离策略 蒸馏 在多任务设置中性能下降:聚合来自多个任务的数据会引入大量可能超出学生能力的行为模式,迫使其对行为进行平均并导致性能下降。相比之下,同策略 蒸馏 是模式搜索,但需要强初始化。受这些观察的启发,我们提出了一种两阶段方法:离策略 蒸馏,然后是 同策略 细化。对对话代理和基于文本的游戏的评估证实,这种两阶段方法与单任务 RL 专家对每个单独任务的性能相匹配,而单独的 离策略 或 同策略 蒸馏 无法匹配这种性能。