论文
当用户改变主意时:测量和修复 LLM Agent中的意图漂移
When Users Change Their Minds: Measuring and Repairing Intent Drift in LLM Agents
摘要
LLM Agent通常在多轮交互中运行,其中用户意图在执行之前发生变化。我们研究意图漂移:用户意图的被取代部分继续影响最终答案或工具操作的故障模式。我们引入了 IntentFlux,这是一个可执行的基准测试,它将可验证的任务转换为具有受控意图变化的对话,同时保留其原始评分器。在 627 个案例的校准中,由于对话包含更多被取代和撤回的信息,平均任务得分从 0.476 下降到 0.384。在八个模型中,当相同的最终任务必须从不断发展的对话中恢复而不是在单轮中直接给出时,完全正确的解决方案的比率会显着降低。我们进一步引入了 StateForge,它在生成之前明确维护了活跃的需求。在一般测试中,它将平均任务得分从 0.367 提高到 0.467。提供真实的最终状态进一步提高了性能,但仍然无法恢复单轮性能,这表明状态估计误差只能解释部分差距。这些结果将意图漂移确立为可测量的多轮故障模式,并将显式状态维护确立为部分缓解措施。