论文

更好的描述性推理跟踪质量与推荐有效性之间的脱节

The Disconnect Between Better Descriptive Reasoning Trace Quality and Recommendation Effectiveness

模型评测模型行为与机制分析

摘要

最近的工作重点是改进生成推荐的明确自然语言描述性推理轨迹。这包括通过思想链推理增强语义 ID (SID) 预测的系统。然而,由于 SID 是不透明的学习标识符而不是自然语言,因此在 LLM 可以对它们进行推理之前,它们需要昂贵的对齐。这提供了一个受控的实验设置,其中项目表示(标题与 SID)和语义基础(最小与扩展 SID 对齐)都可以独立变化。因此,我们使用共享的 Qwen3-1.7B 主干,在三个 Amazon 产品领域的 2 x 2 因子研究中,首次对语义 ID 和自然语言标题的描述性推理跟踪质量进行了受控比较。我们发现,在标准 SFT 和 RL 训练下,引入显式描述性推理轨迹会降低传统离线推荐的有效性,尽管自然语言标题会产生更加基础和可解释的轨迹。广泛的 SID 对齐提高了描述性跟踪质量,但没有提高传统离线推荐的有效性,而更丰富的奖励信号部分恢复了性能。总的来说,我们的结果表明,在本文研究的训练目标和评估协议下,提高描述性推理跟踪质量本身不足以持续提高传统离线推荐的有效性。