论文

模块化表示压缩:采用 LLM 以获得高效且有效的建议

Modular Representation Compression: Adapting LLMs for Efficient and Effective Recommendations

模型优化模型压缩

摘要

最近,大语言模型(LLM)拥有先进的推荐系统(RS),最近的工作已经开始探索如何将LLM集成到工业RS中。虽然大多数方法离线部署 LLM 来生成和预缓存 RS 的增强表示,但 LLM 的高维表示会带来大量的存储和计算成本。因此,有效压缩 LLM 表示至关重要。然而,我们在表示压缩过程中发现了一个违反直觉的现象:中间层表示优势(MRA),其中 LLM 中间层的表示在推荐任务中优于最终层的表示。这种退化的最终层使得现有的压缩方法(通常在最后层上进行压缩)变得次优。我们基于模块化理论解释这一点,即 LLM 开发自发的内部功能模块化,并迫使最后一层专门从事代理训练任务。因此,我们提出 \underline{M}odul\underline{a}r \underline{R}representation \underline{C}ompression (MARC) 来显式控制 LLM 的模块化。首先,模块化调整明确引入了压缩和任务适应模块,使 LLM 能够严格作为表示学习模块运行。接下来,为了使每个模块都适合其特定任务,模块化任务解耦使用信息约束和不同的网络结构来解耦任务。大量实验验证了 MARC 可以解决 MRA 问题并产生有效的表示。值得注意的是,MARC 在大规模商业搜索广告场景中的在线 A/B 测试中实现了 2.82% 的 eCPM 提升。