论文
TwiSTAR:快思考,慢思考,然后行动,自适应推理的生成推荐
TwiSTAR:Think Fast, Think Slow, Then Act,Generative Recommendation with Adaptive Reasoning
摘要
使用语义 ID (SID) 的生成推荐已成为一种有前途的范例,但现有方法在所有用户历史中统一应用固定的推理策略,要么是快速直接生成,要么是缓慢的思想链推理。这种方法产生了一种权衡:快速推荐模型在硬样本上产生次优的准确性,而总是调用缓慢的推理会导致令人望而却步的延迟并浪费简单情况下的计算。为了解决这个问题,我们提出了“快思考、慢思考、然后行动”的框架,该框架能够学习根据用户序列自适应地分配推理工作。我们的系统为 LLM 配备了三个补充工具:基于 SID 的快速 检索器、轻量级候选排名器以及在推荐之前生成明确理由的慢速推理模型。至关重要的是,我们通过将项目到项目的知识转化为自然语言解释,将协作常识注入到慢速模型中。经过监督热身和代理强化学习训练的规划器可以动态决定调用哪个工具。对三个数据集的实验表明,我们的方法优于强大的基线,与统一的慢速推理相比,实现了一致的准确性增益,同时减少了推理延迟。