论文

玩转ZendoWorld:挑战AI智能体的主动视觉概念归纳

Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction

智能体系统Agent任务评测

摘要

构建智能系统的核心挑战是使智能体能够联合感知复杂输入、对隐藏模式形成假设、并设计信息性实验来检验它们。为研究该问题,我们提出ZendoWorld:受控交互环境——智能体必须推断关于视觉游戏观察的逻辑规则、经提议新场景获取信息、并基于游戏环境反馈精炼其假设。我们评估多个智能体:纯VLM推理、贝叶斯粒子滤波、动态概念发现与神经符号方法。主要发现:(1) 对观测样例预测标签的高准确率并不意味着恢复底层规则;(2) 感知与归纳对不同智能体类别是不同的瓶颈;(3) 基于VLM的智能体提出近乎无信息量的实验——未能主动降低假设不确定性。为对比,我们收集该任务的人类数据——揭示归纳推理的差距,尤其对更复杂的规则。总体而言,ZendoWorld朝评估智能体迈出重要一步,并识别具体改进途径——尤其在科学发现等领域。

玩转ZendoWorld:挑战AI智能体的主动视觉概念归纳:论文配图
图 1:ZendoWorld 在受控视觉环境中结合了感知、归纳和实验。