论文

学习提问:在预算范围内获取 SLM-LLM 合作的信息

Learning to Ask: Information Acquisition for SLM-LLM Collaboration, under a budget

模型训练强化学习RLVR

摘要

小语言模型 (SLM) 和大语言模型 (LLM) 之间的协作提供了将较小模型的效率与较大模型的强大推理能力相结合的机会。现有方法主要将这种协作构建为计算分配问题,确定哪个模型应该处理推理过程的每个部分。然而,在基于黑盒 API 的设置中,由于粗粒度委派或跨模型切换的上下文重复传输,这种范例可能效率低下。在这项工作中,我们在 API 预算约束下将 SLM-LLM 协作制定为信息获取问题。 SLM 仍然是主要推理器,仅在需要时选择性地查询黑盒 LLM 顾问,发出有针对性的查询,而不是委托推理过程本身。为了实现这一策略,我们开发了一个三阶段的 RLVR 框架,该框架学习是否调用顾问程序、如何制定有用的查询以及如何通过共同改进顾问程序调用和信息使用将协作集成到推理过程中。在数学推理和编码任务中,我们的方法提高了现有协作基线的性能-成本权衡,并且在某些设置中,匹配或超过了预言机问题级路由。最后,我们表明我们的策略可以转移到其他顾问模型系列,而无需进一步训练。