论文
NarrativeWorldBench:长视界共创音频剧的前沿饱和基准和潜在世界模型
NarrativeWorldBench: A Frontier-Saturated Benchmark and a Latent World Model for Long-Horizon Co-Creative Audio Drama
摘要
长篇连载音频剧的剧情长达 200 至 800 集,是一种主要的创作媒介,也是前沿 大语言模型 (LLM) 失败的场景。我们在一组统一的结构性叙事指标上对 21 个模型进行了基准测试,涵盖经典、微调、开放前沿、封闭前沿和推理层。所有封闭边界系统在带 [0.78, 0.81] 中的情节节拍 F1 处饱和,并在地平线 h=200 时崩溃约 -0.20 F1。我们引入了 NarrativeWorldBench,这是一个开放基准,包含在 {10, 20, 50, 100, 200} 范围内评估的九个叙事结构指标,并对四种印度语言(印地语、泰米尔语、泰卢固语、马拉地语)进行跨语言评估。我们引入了 N-VSSM,一种叙事变分状态空间模型,它通过具有事件条件后验和 8B 解码器的 Mamba-2 主干在 200 多个情节中维持结构化的 256 维潜在世界状态。 N-VSSM 在所有范围内保持绘图节拍 F1 >= 0.84,计算量比封闭边界带低 4 倍。学习的文化传递函数将跨语言保真度提升了 +0.20 到 +0.23 Likert 点。在一项受试者内部作者研究(n = 12 名专业作者,240 次试验)中,N-VSSM 在 71% 的情况下在长弧一致性方面优于 Claude Opus 4.5,并且在可控性方面评分高出 +1.3 Likert 分。