论文
AGI Maze:面向世界建模智能体的基准框架
AGI Maze as a Benchmark Framework for World-Modeling Agents
摘要
大语言模型(LLM)是强大的模式补全系统——但其默认运作模式——从静态上下文预测下一token——并不能可靠产生对外部世界的持久、可操纵表示。许多看似文本推理的任务——一旦环境部分可观测、有状态、且要求对隐藏状态的记忆与结构化假设——就变得困难得多。AGI Maze是一个无需高维感官输入即可构建此类环境的轻量框架。它提供一族基于网格的迷宫任务——带干净API与多档难度。目标是创建智能体必须学习并使用世界状态表示的基准——而非仅在易得观察上推断局部规则。我们对若干原生LLM在简单迷宫上的初步评估表明——它们无法在LLM推理时于内部表示迷宫。我们还引入一个基线智能体——允许其将消息历史用作工作记忆——在智能体运行时构建观察描述。虽然这能改善性能——但在对人类绰绰有余的步数预算内——LLM智能体仍无法可靠解出哪怕小型迷宫。