论文

超越连续性:LLM 多轮对话中上下文切换的挑战

Beyond Continuity: Challenges of Context Switching in Multi-Turn Dialogue with LLMs

模型评测模型能力评测

摘要

在多轮对话中与 大语言模型 (LLM) 交互的用户通常会优化他们的请求或转向新主题。然而,LLM 经常会错过这些主题转换,并继承之前的不相关上下文,从而导致不准确的响应。在本文中,我们对 LLM 的多回合理解进行了压力测试,并研究了以下两个子任务:(1)检测用户在当前回合中是否进行了旋转或精炼,以及(2)从之前的回合中筛选出相关上下文。为此,我们根据来自不同领域的真实数据集构建综合基准,以模拟不同难度级别的上下文变化。然后,我们评估了十个 LLM(开源、闭源和推理)的零样本性能,并证明只有某些推理和强指令 LLM 在检测枢轴方面是准确的;开放权重 LLM 难以完成任务,即使有明确的提示,也经常携带陈旧的上下文;所有模型都存在位置偏差。根据结果​​,我们讨论了提高 LLM 多匝功能的长期鲁棒性的关键要点。