论文
用于评估交互式叙事代理的 NARRA-Gym
NARRA-Gym for Evaluating Interactive Narrative Agents
摘要
交互式叙事任务需要 LLM 维持一个连贯、不断发展的故事,同时适应用户的多个回合。然而,适合这种设置的基准是有限的:现有的评估通常侧重于静态提示、孤立的故事生成或事后评级,因此忽略了模型是否可以共同管理故事生成、长上下文状态和节奏、角色模拟、移情个性化和基于故事的工件。我们引入了 NARRA-Gym,这是一个可执行的评估环境,可将稀疏的情感种子转变为完整的交互式故事情节,并记录完整的模型循环轨迹,包括故事构建、记忆更新、规划、节奏干预和可选的工件合成。我们使用受控的 LLM 作为法官对八个基准人物角色进行扫描,并使用参与者对定制模型输出进行评分的人工评估来评估九个前沿 LLM。我们的结果显示模型、角色和评估维度之间存在巨大差异:产生流畅故事的模型仍然可能在鲁棒性、用户体验或阻力敏感的个性化方面失败。这些发现表明,交互式叙事为评估长期的、用户自适应的 LLM 行为提供了一个有用的基准,超越了孤立的故事质量。