论文

为什么AGI需要世界模型:LLM在何处失败以及世界模型可能如何胜出

Why We Need World Models for AGI: Where LLMs Fail and How World Models May Outperform

模型评测基准与评测资源

摘要

大语言模型在语言生成与知识密集型任务中表现出色,但在需要因果推理、持久状态跟踪与长程规划的场景中仍然受限。我们认为这些局限可能源于目标层面的错配:序列预测与对潜在环境动态的推理之间存在不一致。为形式化这一区分,我们提出潜在动态推断(Latent Dynamics Inference, LDI),这一概念性视角将语言与多模态观察解释为底层转移动力学的部分证据。为实证考察这一视角,我们提出Flux,一个完全通过自然语言规则规定的序贯推理环境。作为概念验证案例研究,这些规则首先被编译为显式的状态转移模拟器,表明结构化的潜在转移动力学在某些情况下可以从文本规则描述中被可操作地提取出来。这使得在纯文本观察上运行的LLM与直接在提取出的潜在状态空间中训练的强化学习智能体之间得以进行受控比较。在该案例研究中,能够显式访问潜在状态空间的智能体在长程对局中表现出显著更稳定的行为,总胜率约为79%,而LLM仅为11%。定性分析进一步揭示了与不稳定的持久状态跟踪相一致的失败模式,包括无效动作、状态跟踪错误与短程推理失败。Flux环境的完整实现可在 https://github.com/FeisalAlaswad/FLUX-RL-Agent 获取。在所评估的设定下,这些结果表明,若缺乏持久状态跟踪与转移建模机制,仅靠强大的序列预测可能难以支撑稳健的长程动态推理。

为什么AGI需要世界模型:LLM在何处失败以及世界模型可能如何胜出:论文配图
图 1:令牌表示空间 𝒳\mathcal{X} 与潜在世界状态空间 𝒮\mathcal{S}。 LLM 在 𝒳\mathcal{X} 中对统计依赖性进行建模,而世界模型则在 𝒮\mathcal{S} 中捕获因果动态。映射 P⁡(xt∣st)P(x_{t}\mid s_{t}) 表示从状态到观测值的有损投影。