论文
用自我回忆思维提高多轮对话一致性
Improving Multi-turn Dialogue Consistency with Self-Recall Thinking
摘要
基于 大语言模型 (LLM) 的多回合对话系统通常很难跟踪非相邻回合之间的依赖关系,从而破坏了一致性和可扩展性。随着对话时间的延长,重要信息变得稀疏并被埋没在不相关的上下文中,而处理整个对话历史会带来严重的效率瓶颈。现有的解决方案要么依赖高延迟外部存储器,要么通过迭代汇总丢失细粒度的细节。在本文中,我们提出了自我回忆思维(SRT),这是一个旨在解决多轮对话中的远程上下文依赖和稀疏信息信号的框架。 SRT 识别有用的历史转折点,并使用它们生成上下文适当的响应,使模型能够在推理过程中选择性地回忆和推理上下文。这个过程产生了一个内生推理过程,该过程集成了可解释的召回步骤,而无需外部模块。 SRT包含:(1)依赖构建:生成并将其转换为自回忆链; (2)能力初始化:训练使推理链具有召回词元能力; (3)推理改进:通过可验证的奖励提高准确性,以优化正确答案的回忆和推理。在多个数据集上的实验表明,与之前的方法相比,SRT 将 F1 分数提高了 4.7%,并将端到端延迟降低了 14.7%,实现了推理延迟和准确性之间的平衡,并超越了最先进的基线。