论文
当故事演变时:开放世界模拟中跨代理架构的 LLM 故事讲述基准测试
When Stories Evolve: Benchmarking LLM Storytelling Across Agent Architectures in Open-Ended World Simulations
摘要
大语言模型 可以写出流利的故事,但开放式的故事讲述需要的不仅仅是本地流利。在不断发展的世界模拟和人工智能原生游戏中,随着世界的变化,模型必须保留事实、关系、因果依赖性和角色状态。我们引入了 WSE-bench,这是一个流程基准,可单独评估动态 LLM 故事讲述中的持续生成、规范一致性和有意义的发展。 Generation Coverage记录了所产生的计划叙事步骤的比例;当佳能出现问题时,保持一致性;丰富度衡量的是玩家塑造的分支轨迹发展的有意义程度。在前沿模型中,一致性和丰富性并没有形成平滑的权衡:它们的经验帕累托前沿是非凹的,具有一些没有正线性权重可以选择的非支配中间配置。添加结构可以丰富轨迹,但它并不能统一提高连贯性,并且可能会缩短轨迹。模型规模主要改善了持续生成,但没有在规范一致性或有意义的发展方面产生可靠的收益。这些结果表明,持续的生成、规范的一致性和有意义的发展是不同的,有时是相互竞争的能力。 WSE-bench 通过将叙事评估从已完成的故事扩展到创建故事的过程,使这些动态变得可见。