论文
LLM冷启动推荐中的检索瓶颈诊断与缓解
Diagnosing and Mitigating Retrieval Bottlenecks in LLM-Based Cold-Start Recommendation
摘要
LLM常被用作推荐重排序器,期待其语义能力帮助冷启动与长尾。五领域基准显式分开重排序质量与检索覆盖率。保证目标商品存在的正对照中,校准过的LLM重排序器在自然流量下仍不能稳定超过强协同及内容基线;Qwen3从80亿扩至320亿参数缩小差距,却在多数领域未消除差距。不额外注入目标商品时,标准单检索器仅有4.6%–22.9%的情况将目标放入200项候选池,主要由于32%–91%的冷启动目标是没有训练交互的全新商品。LHF在多检索器联合池上用验证数据训练混合融合层,是所测唯一在五领域均超过各单检索器的组合器;它在内容丰富领域利用理想召回提升空间的17%–61%,在协同信号强的领域仅为5%–7%。端到端实验中,学习式非LLM排序能利用LHF池,提示级LLM重排序却常使效果下降。目标已在候选中的文本丰富领域仍存在局部语义优势,但在当前先检索再重排序流程中多难实现。数据:https://doi.org/10.5281/zenodo.20991039;代码:https://doi.org/10.5281/zenodo.20993306。