论文
MNIST-PRO:MNIST以AI智能体部分可观测世界的形式回归
MNIST-PRO: MNIST is Back as a Partially Observable World for AI Agents
摘要
部分可观察环境中的人工智能代理需要协调主动感知与工作记忆,以维持不断发展的感知状态。然而,现有的基准很难隔离这种感知状态的构建和解释能力,因为它们引入了物理和控制的复杂性。我们使用 MNIST-PRO 来解决这个问题,这是一个基准测试,通过将 MNIST 数字识别转换为具有回溯约束的顺序的、基于一瞥的搜索任务来隔离代理感知。我们评估了四种记忆表示形式的十个多模态模型,包括原始视觉历史、文本状态、结构化度量网格图和统一的视觉画布。虽然模型在完全可观察性下表现出色,但部分可观察性暴露了明显的性能差距。我们确定了三个不同的瓶颈。首先,感知状态的构建和解释提出了挑战,因为智能体努力整合碎片化的一瞥。其次,智能体通常在看到完整序列之前就停止探索。第三,即使面对随后的矛盾证据,模型也常常无法修正早期的错误信念。这些结果表明,仅仅获取视觉证据是不够的。代理还必须能够构建和更新可靠的感知状态。
