论文
LLM 迷失在不断变化的用户意图中
LLMs Get Lost in Evolving User Intent
摘要
随着 LLM 的能力变得越来越强大,它们越来越多地被部署为协作代理,通过迭代交互来承担用户委派的任务。然而,真正的交互本质上是动态的:用户很少预先明确他们的意图,而是随着对话的展开而披露、修改和重塑它。尽管如此,LLM 仍然主要在单轮、完全指定的设置中进行评估或训练,留下了一个基本问题:LLM 在对话过程中不断演变的用户意图跟踪和行动效果如何?为了研究这个问题,我们引入了一个框架,将静态的单轮任务转换为动态的多轮对话,其中用户的意图在轮次中不断演变——增量地揭示、修改,有时在对话中重定向——同时保留每个任务的原始评估协议,使现有的基准测试能够重新用作受控测试平台,而无需新的注释。在多个任务中,我们发现了一个一致的现象:强大的静态设置性能不会转移到不断变化的意图设置,模型系列之间的性能大幅下降。我们的研究结果指出了一个根本性的差距:今天的 LLM 尚未忠实地跟踪用户不断变化的意图并采取行动,这种能力对于静态评估来说是不可见的,但对于未来的协作代理至关重要。