论文
LLM智能体能坚持脚本吗?互动叙事长期一致性的基准
Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives
摘要
大语言模型 (LLM) 的快速发展通过实现开放式和流畅的交互式故事讲述正在彻底改变游戏人工智能。然而,现有的研究在很大程度上忽视了在不受限制的用户干预下保持长期逻辑一致性和叙述完整性的关键挑战。为了解决这个问题,我们将这一挑战称为叙事承诺保存(NCP),并以互动叙事作为我们的测试平台。我们介绍 NCP-Bench,这是源自电影概要的 100 个叙事环境的基准。每个环境都包含一个结构化的叙述规范(轨迹、承诺和初始事实),我们可以在玩家代理和叙述者代理之间的整个交互过程中自动检查这些规范。最先进的 LLM 的实验揭示了巨大的长期一致性差距:高语言质量并不能保证承诺的保存;即使是强大的模型,在对抗性干预下也经常会产生逻辑上冲突的内容,表现最好的模型(GPT-5.2)在 20 轮后仅实现 42% 的生存率,模型之间的事实冲突率从 40% 到 68% 不等,并且只有孤立的运行才能满足 100 轮限制内的所有成就承诺。