论文

面向生成式推荐的难度感知语义ID优化

Difficulty-Aware Semantic-ID Optimization for Generative Recommendation

模型训练强化学习RLVR

摘要

基于语义ID(Semantic-ID)的生成式推荐把检索与排序转化为对层次化物品标识符的自回归生成。常见配方是SFT后接GRPO,但朴素的GRPO与这种树结构任务匹配不佳。在冻结的SFT检查点下,对许多提示而言,精确目标并不在50束受限排序的前16个候选之中;在更难的情形中,没有任何候选进入目标SID分支。这一提示级诊断引发了一个训练层面的担忧:当在线策略GRPO组同样缺失目标时,即使某些候选遵循目标路径的一部分,物品级奖励也可能产生微弱或退化的奖励变化。我们提出难度感知语义ID优化(DASO),一种树感知的后训练方法,把这一失败模式当作在线rollout分配问题来处理。DASO不使用固定难度桶或均匀注入真值补全,而是按前缀匹配深度刻画每个当前rollout组,定位候选离开目标路径的瓶颈SID层级,并在保留原始rollout作对照的同时,把组内一个有界的部分重新分配给前缀引导的补全。SID前缀奖励提供分级信用,而辅助SFT锚点缓解了在SFT检查点已解决样例上的回退。在公开基准上,DASO在12项指标中的11项上超过MiniOneRec风格的GRPO,并在12项指标中的9项上取得最佳结果;它还在内部推荐任务上改进了大多数逐层级召回指标。

面向生成式推荐的难度感知语义ID优化:论文配图
图1:DASO 的工作流程。对每个提示,DASO采样原始rollout,构建MM级前缀深度画像,将有界子集重新分配给瓶颈引导的补全,然后应用奖励归一化和GRPO。各面板是不同目标缺失情形的示意示例:无前缀失败和部分前缀案例由同一规则处理。辅助SFT锚点降低在精确命中案例上的性能退化。