论文
基于 LLM 的会话推荐中的检索、评分和解码形状性能和稳定性
Retrieval, Scoring, and Decoding Shape Performance and Stability in LLM-based Conversational Recommendation
摘要
大语言模型 (LLM) 越来越多地用作会话推荐系统中的重排序器,但测量的增益在很大程度上取决于检索和推理协议。在 ReDial 对话电影推荐基准上,我们将专有的、开放权重和微调的 LLM 重新排序器与共享检索然后重新排序管道中的协作过滤和顺序基线进行比较。我们改变候选池大小、第一阶段 检索器 和解码温度。通过共享语义前 250 名候选池和严格的候选感知评分,最佳专有重新排序器的 NDCG@10 达到 0.1497,而最强的非 LLM 基线为 0.0939。同样的重排序器在零样本生成中达到 0.2925,这表明无约束评分可以产生比匹配池评估大得多的明显优势。在此协议下,没有评估的开放权重 LLM 的性能优于经过调整的浅层自动编码器基线。对于最强大的专有和开放权重重排序器,从语义候选切换到协作过滤候选者可将 NDCG@10 提高 50% 以上,这表明测得的重排序器性能对候选者生成高度敏感。对于最佳的专有重新排序器,将温度从 0 提高到 1.0 会使前 10 名杰卡德距离从 0.0900 增加到 0.1240,而平均 NDCG@10 的变化可以忽略不计,而较弱的 LLM 显示出更大的退化。这些重拨结果支持将候选生成、候选池大小、评分策略和解码配置视为必需的报告字段而不是实现细节。