论文

指导语义 ID 的粗略级别使精细级别变得可学习

Guiding the coarse levels of semantic IDs makes the fine levels learnable

应用与实践结构化分析、预测与决策

摘要

生成检索通过简短的语义 ID 表示每个项目,并将推荐作为该序列的自回归生成。由于分词器经过独立训练来重建项目嵌入,因此其代码既不与下游 LLM 也不与最终任务对齐。因此,几乎每个 SID 系统都花费额外的精力来弥补这一差距——对齐语料库、推理/RL 或每个标记编码器以使代码清晰,或者学习标记器监督以使其具有任务感知能力——但恢复的含义是内容派生的,可能不是任务所需的含义。我们引入了Guided SID,它通过构建使最重要的级别变得最有意义:我们强制粗略的RQ-VAE级别对预定义的分类属性进行编码——通过确定性的监督索引分配(用属性标签覆盖最近邻选择)来选择基于文本(因此对于LLM来说是易读的)和任务相关的属性,同时保持码书可学习(它们仍然接收重建梯度)。 trie 合并构造将任何高基数或集值属性映射到固定代码预算上,同时保持合并的存储桶在语义上一致。引导本质上不需要任何成本:尽管固定了粗略水平,但碰撞和重建匹配或击败了原始基线。在仅 SID 编码不同的匹配的端到端 A/B 中,引导检索器在我们测量的每个列表长度处提高了召回@k(k=1 时为 1.36x,k=10 时为 1.39x),将平均倒数排名从 0.0260 提高到 0.0355,并且预测预定义属性的频率提高了 4.2 倍。