论文
MLP 是高效的精炼生成推荐器
MLPs are Efficient Distilled Generative Recommenders
摘要
采用语义 ID (SID) 的生成推荐模型展现出强大的潜力,但其实际部署受到波束扩展自回归解码的高推理延迟的瓶颈。在这项工作中,我们发现标准的注重大量注意力的 Transformer 解码器代表了该任务的结构性杀伤力:SID 的分层性质使得预测难度在第一个标记之后急剧下降,从而使重复的注意力计算高度冗余。在这种见解的驱动下,我们提出了 SID-MLP,这是一种以 MLP 为中心的轻量级 蒸馏 框架,从根本上简化了 GR 的解码范例。我们的方法不是执行复杂的、逐步的注意力机制,而是在单个操作中捕获全局用户上下文,与顺序标记预测分离。然后,我们将重度自回归教师提炼为特定位置的 MLP 头,消除密集的注意力开销,同时保留前缀和上下文依赖性。大量实验表明,SID-MLP 与教师模型的准确性相匹配,同时将推理速度提高了 8.74 倍。至关重要的是,这种 蒸馏 策略可以作为不同主干网和分词器设置的即插即用加速器。此外,我们引入了 SID-MLP++,扩展了我们的 蒸馏 框架以取代 Transformer 编码器,从而进一步减少延迟。最终,我们的工作表明,解码器端 MLP 蒸馏 是结构化 SID 推荐的有效加速路径,而完全编码器替换则提供了额外的速度与精度权衡。