论文
基于 LLM 的生成式列表推荐中的推理加速的位置感知起草
Position-Aware Drafting for Inference Acceleration in LLM-Based Generative List-Wise Recommendation
摘要
基于 大语言模型 (LLM) 的生成式列表推荐技术发展迅速,但解码仍然是顺序的,因此容易出现延迟。为了在不改变目标分布的情况下加速推理,推测解码 (SD) 使用小型草案模型一次提出几个下一个词元,并使用目标 LLM 来验证并接受最长前缀,每轮跳过多个步骤。然而,在生成推荐中,每个项目由多个语义 ID 标记表示,通常带有分隔符,并且当前草案通常统一处理这些标记。这忽略了两个实际事实:(i)词元的语义取决于其项目内的位置,以及(ii)不确定性往往随着推测深度而增加。如果不对这些影响进行建模,SD 的加速可能会受到限制。我们引入了 PAD-Rec(用于生成推荐的位置感知绘图),这是一个轻量级模块,可以通过两个互补信号来增强草稿模型。项目位置嵌入明确地编码每个标记的项目内槽,从而增强结构意识。步骤位置嵌入对草稿步骤进行编码,使模型能够适应深度相关的不确定性并提高提案质量。为了协调这些信号与基本特征,我们添加了简单的门:项目槽的可学习系数和草稿步骤的上下文驱动门。该模块是可训练的,易于与标准草案模型集成,并且增加的推理开销可以忽略不计。对四个真实世界数据集的广泛实验表明,与强 SD 基线相比,挂钟加速高达 3.1 倍,平均挂钟加速增益约为 5%,同时在很大程度上保持了推荐质量。