论文

通过模型合并实现基于 LLM 的推荐系统的高效推理

Towards Efficient Reasoning in LLM-Based Recommender Systems via Model Merging

模型优化模型合并

摘要

基于 大语言模型 的推荐系统越来越多地采用慢速思维模型,在做出预测之前生成逐步推理,通常比直接预测的快速思维模型获得更高的准确性。然而,它们的推理轨迹通常过于冗长,增加了推理成本,却没有相应提高准确性。现有的基于训练的推理压缩方法通常会产生大量的适应成本,而推理时间方法很脆弱且难以扩展。这些限制促使模型合并成为一个有前途的 无需训练 方向,用于在共享参数空间中的模型之间传输专门的行为。特别是,将慢速思维模型与快速思维模型相结合,提供了一种平衡推荐准确性和推理简洁性的自然机制。为此,据我们所知,我们提出了第一个用于推荐系统中推理压缩的模型合并框架。与跨模型组件应用统一合并系数的传统合并方法不同,我们的方法在个体注意头级别执行细粒度合并,捕获推荐推理中的异构模式。每个注意力头根据其对关键推理证据的贡献及其对参数变化的敏感性被分配一个不同的合并系数,从而能够选择性地将快速思维模型的简洁行为注入到慢速思维模型中,并在不影响推荐质量的情况下减少推理的冗长。对三个基准数据集的实验表明,我们的方法将推理长度减少了 24.3%,同时在保持推荐准确性方面优于竞争模型合并基线。代码可在 https://github.com/linhledieu/REAM 获取。