论文

一个事件值得一个词元:工业规模的事件词元化 LLM 推荐

An Event is Worth One Token: Event Tokenization for Industrial-scale LLM Recommendation

应用与实践行业应用

摘要

基于 LLM 的推荐已根据模型容量和序列长度进行扩展,但每个位置仅编码文本、语义 ID 或一些分类特征,丢弃每个事件可用的丰富用户、项目、上下文和结果信号。在自回归建模下,这会在每个位置产生弱查询,并且由于每个位置都成为下一个位置的上下文,因此整个序列的退化会复合。我们提出了一种以事件为中心的范例,通过其完整的时间快照来表示每次交互,并确定一个新的缩放维度,我们称之为快照分辨率:每个事件编码的信息量。为了有效地扩展快照分辨率,我们引入了 AMBER(通过瓶颈事件表示进行自回归建模),它将每个时间快照压缩为一个紧凑的事件词元,即一种新的 LLM 输入模态。该表示是端到端学习的,而事件词元是预先计算和缓存的以用于服务,将快照分辨率与实时服务计算解耦。在工业规模的排名和检索基准上,AMBER 相对于替代推荐范例推进了计算质量帕累托前沿。在足够的容量下,单个统一标记器甚至优于专用的每个实体标记器,证明了跨结构不同实体类型的积极转移。 AMBER 的事件词元还可以跨模型架构转移:当作为服务时间历史功能集成到高度优化的非 LLM 排名器中时,它们会产生统计上显着的改进。进一步扩展事件标记器容量可提供额外的改进。