论文
LLM 也需要语义 ID 编码器
LLMs Need Encoders for Semantic IDs Too
摘要
多模态 LLM 使用专用编码器来桥接非语言模态(图像的视觉编码器、音频编解码器词元的深度模型),因为原始词元嵌入本身无法捕获模态特定的结构。我们认为,语义 ID(SID)(生成推荐中使用的分层代码)构成了另一种这样的模式:SID 级别标记的含义取决于其前缀上下文,而当前的系统只是将 SID 标记添加到词汇表中,并依靠训练从头开始学习这些依赖于上下文的含义。我们提出了 PrefixMem,一种基于前缀 n-gram 内存表的轻量级 SID 编码器,它为 LLM 在 SID 词元位置提供结构化的、前缀条件的表示。与多模态 LLM 中的视觉编码器一样,PrefixMem 可以独立进行预训练,然后连接到任何 LLM 进行联合训练。我们对来自 Pinterest 的多个 LLM 系列的大规模数据进行了评估,结果表明,在匹配的训练计算中,PrefixMem 将最深级别的 SID 准确度相对提高了 46%,将全 SID 检索召回率提高了 22%。编码器的优势集中在贪婪解码失败的困难示例上,相对准确度增益高达 77%,这证实了 SID 词元与其他非语言模态一样受益于专用编码器。