论文

如果 LLM 食言了怎么办:多轮交互中的因果历史效应

What if LLMs Ate Their Words: Causal History Effects in Multi-Turn Interaction

模型评测模型行为与机制分析

摘要

多回合交互创建了一个反馈过程,其中 LLM 之前的响应成为后续行为的上下文。之前的工作显示了严重的多轮退化,并且助手生成的历史记录可能会影响以后的行为。然而,目前尚不清楚这些影响如何在模型、任务、回合以及模型内部表现出来。我们研究了六个任务系列和五个模型中的这些差距。从完全指定的单轮输入(FULL)到逐步揭示的多轮交互(SHAARDED)的退化显然取决于任务和模型,并且更强的一次性性能并不意味着更强的交互鲁棒性。然后,我们通过重放每个轨迹中已经观察到的用户消息来回顾性分析已完成的分片对话,同时仅编辑助手生成的历史记录。用中性内容替换先前的助理响应(称为中和)会使 2,973 个轨迹的下游最小-最大归一化性能改变 +.027。在预先指定的长度控制子集上,短和长度匹配的中和产生几乎相同的效果(+.069 与+.068),这表明简单的上下文缩短不足以解释历史编辑的效果。转弯手术每次对一名助理转弯进行进一步干预。在 237 个选定的降级轨迹中,63.7% 包含至少一种有益干预,而大多数测试位置保持不变;对于二进制任务,48.4% 的人承认失败到成功的逆转。一项开放权重案例研究将行为相关的历史变化与可测量的下游状态差异联系起来,但发现了依赖于任务的而不是通用的内部特征。总体而言,助理生成的历史对多回合性能具有积极但选择性的影响,从而激发选择性而不是统一的历史管理。