论文
GRIP:用于高效推理的精细奖励引导参数插值
GRIP: Granular Reward-Guided Parameter Interpolation for Efficient Reasoning
摘要
面向推理的 大语言模型 通常通过生成长思维链来实现强大的问题解决性能,但这种行为大大增加了推理成本和延迟。相比之下,指令调整模型往往会回答得更简洁,但往往缺乏可比的推理能力。这种准确性与效率的不匹配催生了一种轻量级方法,该方法结合了两种模型的优势,而无需进行完整的模型重新训练。在本文中,我们提出了 GRIP(粒度奖励引导参数插值),这是一种用于高效推理的奖励引导参数插值框架。给定具有相同架构的推理模型和指令模型,GRIP 将可学习的插值比率分配给各个模块,并仅优化这些比率,同时保持两个源模型冻结。插值比率是通过奖励信号进行训练的,该奖励信号有利于正确且简洁的响应。实验表明,GRIP 比固定或基于搜索的合并基线实现了更好的准确性-效率权衡,并进一步揭示了与高效推理相关的模块级融合模式。