论文

FLASH:并行解码与语义对齐恢复SimHash生成推荐能力

Rethinking Semantic ID Construction for Generative Recommendation: SimHash with Parallel Decoding and Semantic Alignment

模型推理解码与生成控制

摘要

基于语义 ID 的生成推荐将每个项目表示为离散 token 的序列,从而实现项目语义的结构化建模。一个关键的挑战是构建语义 ID,使其既具有语义表达能力又具有计算效率。虽然最近的方法有利于复杂的学习量化,但简单的基于哈希的方法(例如 SimHash)被广泛认为从根本上来说是较差的。在这项工作中,我们挑战了这一共识,表明明显的性能差距并非源于散列的固有限制,而是源于自回归解码的结构不匹配,加上严格离散化过程中不可避免的信息丢失。基于这一见解,我们提出了 FLASH,这是一个两阶段框架,通过并行解码和显式语义对齐来重振 无需训练 SimHash 标记化。尽管很简单,FLASH 在多个数据集上实现了最先进的性能,而不需要任何标记器 训练,同时在冷启动场景中表现出更强的泛化能力。值得注意的是,我们证明语义对齐是跨不同范式的普遍有效的机制。我们的研究结果表明,通过兼容的解码和语义基础,简单而高效的分词器可以在生成推荐中实现与复杂的学习对应物相当的性能。我们的代码可在 https://github.com/KevinC2015/Flash. 获取

FLASH:并行解码与语义对齐恢复SimHash生成推荐能力:论文原图
图 2:FLASH 概述。第一阶段使用 SimHash 以 无需训练 方式在预先计算的 LLM 文本嵌入上构建语义 ID。第二阶段使用多 token 预测目标执行并行生成建模,并结合语义基础的对齐损失。该设计以结构兼容性和语义基础为指导,使解码范式与标记化结构保持一致,同时补偿信息丢失。