论文

离线指导,在线推理:将 LLM 反馈重用于小语言模型

Offline Guidance, Online Reasoning: Reusing LLM Feedback for Small Language Models

摘要

大语言模型 (LLM) 提供强大的推理能力,但通过商业 API 访问通常成本高昂,而小型语言模型 (SLM) 更容易在本地部署,但推理能力仍然较弱。这种能力部署差距促进了 LLM-SLM 协作,其目的是使用 LLM 功能改进 SLM 推理,同时保留 SLM 的部署优势。现有方法主要遵循两种范式。知识蒸馏使用LLM生成的答案和推理轨迹来离线训练SLM,但需要参数更新和额外的训练。或者,在线协作将难题转交给大语言模型,或者当大语言模型遇到困难时利用大语言模型生成的指导和纠正。在线协作虽然有效,但需要重复的大语言模型访问。此外,针对特定问题产生的指导在推理后被丢弃,并且不能有益于涉及类似推理状态的后续问题。在本文中,我们重点关注一种更受约束的设置,其中 LLM 只能离线访问,SLM 参数保持固定,并且在线推理仅由 SLM 执行。为此,我们提出可重用潜在校正(RLC),它将黑盒 LLM 的一次性自然语言指导转换为 SLM 隐藏空间中的持久校正体验。 RLC 将这些经验存储在外部库中,并根据 SLM 当前的推理状态检索它们,使 SLM 能够在推理过程中重用 LLM 导出的更正,而无需任何在线 LLM 调用。跨多个推理基准和 SLM 尺度的实验表明,RLC 持续改进了 SLM 推理,无需参数更新或在线 LLM 调用。代码可在 https://github.com/ZBH031/reusable-latent-correction. 获取