论文

学习用于生成推荐的可变长度标记化

Learning Variable-Length Tokenization for Generative Recommendation

摘要

生成推荐将推荐重新表述为对离散语义标识符 (ID) 的下一个标记预测。一个基本但尚未探索的设计选择是,现有方法对所有项目采用固定长度标记化,隐含地假设统一的编码能力,而不管项目特性如何。通过四个数据集的系统实验,我们发现了流行度-长度悖论:流行项通过短 ID 实现最佳性能,而尾项则需要更长的代码来捕获区分语义。这揭示了一个严重的不匹配,其中流行的项目受益于丰富的协作信号并且需要最少的语义细节,而尾部项目由于稀疏的交互数据而必须依赖于细粒度的内容特征。为了解决这个问题,我们提出了 VarLenRec,一个用于学习可变长度标记化的框架。我们开发了流行度加权信息预算分配(PIBA),这是一个信息论框架,证明最佳 ID 长度应该随着流行度的负幂而变化。直接实现可变长度分配面临两个技术挑战:标准欧几里得残差量化缺乏支持多种代码长度而不失真的几何能力,并且离散长度决策是不可微的。我们通过双曲残差量化和软长度控制器来解决这些问题,双曲残差量化利用庞加莱球的指数体积增长来自然地分层编码容量,软长度控制器通过由 PIBA 派生的先验正则化的连续层保留概率来实现可微分的长度预测。大量实验表明,VarLenRec 在推荐准确性和训练/推理效率方面比最先进的方法取得了显着改进,揭示了自适应编码能力在生成推荐中的重要性。