论文
审核顺序推荐中的语义增益:轻量级恢复测试
Auditing Semantic Gains in Sequential Recommendation: A Lightweight Recovery Test
摘要
最近的语义和生成检索推荐器报告了相对于仅 ID 顺序基线的实质性改进,但目前尚不清楚这些收益是否来自语言模型推理、语义 ID 生成、端到端语义架构、更强的离线项目表示或补充语义和协作信号。我们通过 LIME-Rec(一种轻量级且可审核的恢复测试)来调查这种归因模糊性。 LIME-Rec 结合了三个独立的专家:SASRec 顺序专家、ItemCF 同现专家和基于冻结 BAAI/bge-base-en-v1.5 项目嵌入的语义专家。他们的完整目录分数按用户标准化,并通过可审核的分数级别融合进行组合,然后进行有界历史校准。融合门和校准头仅安装在验证数据上,不需要服务时语言模型推理,并且可以单独检查每个专家的贡献。在亚马逊美容、玩具和体育领域,LIME-Rec 的 R@10 得分分别为 0.0996、0.1105 和 0.0593,比最强的比较基线高出 7.0%-12.0%。没有历史校准的三专家融合始终优于校准的 SASRec,这表明仅校准并不能解释回收率。跨项目 ID 随机排列项目文本嵌入可将 R@10 降低 13.6%-17.5%,这表明增益取决于真实的项目文本对应关系,而不是额外的表示能力。这些结果表明,在将改进归因于服务时语言建模、语义 ID 生成或更重的语义机制之前,应该排除从离线项目表示和透明融合的轻量级恢复。