论文

OnePred:多轮对话中通过递归意图记忆进行下一个查询预测

OnePred: Next-Query Prediction via Recursive Intent Memory in Multi-Turn Conversations

上下文与知识记忆Agent记忆

摘要

尽管 大语言模型 (LLM) 会话系统每天处理数百万个多轮对话,但它们基本上仍然是反应性的:它们仅在用户键入查询后才做出响应。主动交互的关键一步是下一个查询预测,它仅根据前面的对话来预测用户的后续查询。由于缺乏专门的基准和基本的效率-质量权衡,这项任务的进展受到阻碍:天真地连接完整的对话历史会导致线性增长的词元消耗,而截断到最新的回合会丢弃关键的交叉回合上下文。我们的主要见解是,准确的预测不需要重新阅读原始历史;它足以跟踪用户在主题、未解决的需求和兴趣转移方面不断变化的意图轨迹。我们提出 OnePred,它维护一个递归更新的内存作为其唯一的交叉上下文,限制每轮成本,与会话长度无关。我们通过两阶段强化学习管道来训练模型,首先教导要预测什么,然后要压缩什么,将记忆塑造成面向预测的意图链。为了建立严格的测试平台,我们引入了 NQP-Bench,涵盖三个不同的子集。实验表明,与完整历史输入相比,OnePred 将每轮词元消耗减少高达 22$\times$,同时在预测质量方面始终超过所有基线,并且在较长的对话中获得更大的收益。我们的代码可在 https://github.com/ZBWpro/OnePred 上公开获取。