论文

利用指令调整和合并进行推理模型适应

Leveraging Instruction Tuning and Merging for Reasoning Model Adaptation

模型优化模型合并

摘要

推理语言模型 (RLM) 通过利用推理标记形式的测试时计算,展示了令人印象深刻的性能。然而,这种行为使得 RLM 适应新领域具有挑战性且成本高昂。原因是进一步的训练可能会扰乱学到的行为并降低模型性能。这使得很难利用人工编写的解决方案来利用受监督的 微调 数据:尽管它包含高质量的注释,但它缺乏推理标记。在这项工作中,我们展示了尽管存在这一挑战,如何将这些数据有效地用于 RLM 适应。为此,我们首先使用标准指令调整。接下来,我们利用模型合并将指令调整的模型与原始 RLM 相结合,选择合并比率,以便恢复生成的模型在目标域上的推理行为。我们在编码和文本摘要任务上跨四个 RLM 评估了我们的方法,它将目标任务性能提高了高达 $11.0\%$,同时保留了推理行为并将分布外分数降级限制在平均 $0.7\%$。重要的是,我们的改造高效且经济,每个模型的成本不到 10 美元。