论文

MNIST-PRO:MNIST以AI智能体部分可观测世界的形式回归

MNIST-PRO: MNIST is Back as a Partially Observable World for AI Agents

智能体系统上下文与知识记忆Agent任务评测Agent记忆

摘要

部分可观察环境中的人工智能代理需要协调主动感知与工作记忆,以维持不断发展的感知状态。然而,现有的基准很难隔离这种感知状态的构建和解释能力,因为它们引入了物理和控制的复杂性。我们使用 MNIST-PRO 来解决这个问题,这是一个基准测试,通过将 MNIST 数字识别转换为具有回溯约束的顺序的、基于一瞥的搜索任务来隔离代理感知。我们评估了四种记忆表示形式的十个多模态模型,包括原始视觉历史、文本状态、结构化度量网格图和统一的视觉画布。虽然模型在完全可观察性下表现出色,但部分可观察性暴露了明显的性能差距。我们确定了三个不同的瓶颈。首先,感知状态的构建和解释提出了挑战,因为智能体努力整合碎片化的一瞥。其次,智能体通常在看到完整序列之前就停止探索。第三,即使面对随后的矛盾证据,模型也常常无法修正早期的错误信念。这些结果表明,仅仅获取视觉证据是不够的。代理还必须能够构建和更新可靠的感知状态。

MNIST-PRO:MNIST以AI智能体部分可观测世界的形式回归:论文配图
图1: MNIST-PRO的视觉探索和状态跟踪。最左侧面板显示原始图像( Digit 0), 该图像仍然隐藏在智能体器之外, 只能通过一瞥窗口访问 。为了解决任务, 智能体于连续移动 图像的一瞥窗口, 更新其信念 当它收集新的部分观察。在步骤0, 智能体开始随机抽样的一瞥, 将观察存储在记忆中, 并选择一个动作 。向上移动0和2级,然后向下移动6级。在追踪数字的边界和综合累积观察之后,该物剂在步骤9之前预测标签(Answer ' 0 ' )。