论文

Schema:通过 Agentic 程序归纳发现未知环境

Schema: Discovering Unknown Environments via Agentic Program Induction

智能体系统Agent Harness

摘要

学习在不熟悉的环境中以未知的规则完成任务仍然是 LLM Agent面临的主要挑战。目前的大语言模型Agent经常用散文记录他们的发现,这可能无法提供对环境如何运作的紧凑、明确的描述。受科学家如何将观察结果组织成可测试的预测理论的启发,我们引入了 Schema,这是一种通过交互式程序归纳来组织学习和行动的Agent Harness。 LLM Agent决定调查什么以及如何采取行动,将其对环境不断发展的理解表达为可执行程序。该Harness由一个持久的程序工作区和一小组接口组成,用于根据交互历史记录检查这些程序,在其中进行规划,并在逐步验证下执行计划。 Schema 在相同的基础模型下将 ARC-AGI-3 RHAE 从 58.7% 提高到 99.2%,解决了 100% 的公共 DiG-bench 游戏,并达到了 MazeBench 上前 50 名人类玩家的中位表现。广泛的分析显示了 Schema 在未知机制发现中的有效性,并且消融证实了每个组件的贡献。

Schema:通过 Agentic 程序归纳发现未知环境:图1:Schema观察环境,将发现的机制编码为可执行程序,用于规划和行动,并在进一步交互中完善理解(上)。它在三个基准上均优于使用相同基础模型的基线Harness(下);虚线表示人类参照表现。(a)ARC-AGI-3:25个公开游戏上的RHAE,比较Claude Fable 5在Claude Code和Schema中的表现;人类基线按定义为100。(b)DiG-bench:21个公开游戏中获胜数量,基础模型为GPT-6 Astra。(c)MazeBench:GPT-6 Astra在Codex和Schema中收集的宝石数,与前50名人类玩家的中位表现比较。(正文第4.2节说明:medium、high、maximum推理力度分别完成19、20、21个游戏;图中90.5%对应19/21,不能与maximum条件的100%混用。)
图1:Schema观察环境,将发现的机制编码为可执行程序,用于规划和行动,并在进一步交互中完善理解(上)。它在三个基准上均优于使用相同基础模型的基线Harness(下);虚线表示人类参照表现。(a)ARC-AGI-3:25个公开游戏上的RHAE,比较Claude Fable 5在Claude Code和Schema中的表现;人类基线按定义为100。(b)DiG-bench:21个公开游戏中获胜数量,基础模型为GPT-6 Astra。(c)MazeBench:GPT-6 Astra在Codex和Schema中收集的宝石数,与前50名人类玩家的中位表现比较。(正文第4.2节说明:medium、high、maximum推理力度分别完成19、20、21个游戏;图中90.5%对应19/21,不能与maximum条件的100%混用。)