论文
评估多轮语言模型中的时间一致性
Evaluating Temporal Consistency in Multi-Turn Language Models
摘要
语言模型越来越多地部署在交互式环境中,用户随着时间的推移而不是孤立地推理事实。在这种情况下,正确的行为需要模型来维护和更新对话中先前建立的隐式时间假设。我们通过时间范围稳定性的角度来研究这一挑战:在对话轮次中保留、覆盖或转移时间范围的事实背景的能力。我们引入 ChronoScope,这是一个大规模诊断基准,旨在隔离受控多轮交互中的时间范围行为,包含超过一百万个基于维基数据的确定性生成的问题链。 ChronoScope 评估当后续问题省略显式时间参考、跨越隐式结转、显式范围切换、跨实体传输和较长时间轨迹时,模型是否可以正确保留推断的时间范围。通过对最先进的语言模型的广泛评估,我们发现在受控的多轮设置中,时间范围稳定性经常被违反,尽管有正确的基础知识,但模型常常倾向于当前的假设。这些失败随着交互长度的增加而加剧,甚至在预言机上下文条件下也持续存在,揭示了顺序交互下单轮事实准确性和连贯时间推理之间的差距。我们在 https://github.com/yashkumaratri/ChronoScope 公开提供我们的数据集和评估套件