论文

OPINE-World:以本体错误优先交互探索的程序化世界建模

OPINE-World: Programmatic World Modeling with Ontology-error-Prioritized Interactive Exploration for ARC-AGI-3

智能体系统上下文与知识本体Agent 环境交互

摘要

从交互中学习环境如何运作是构建能适应陌生任务智能体的核心。深度网络学得的世界模型灵活但耗数据——且在训练分布外迁移差。程序合成的世界模型——由LLM写成源代码——并经反例引导归纳综合(CEGIS)精化——则数据高效且可复用——但此前主要在给定对象词表的结构化状态世界上演示——单一程序搜索无法扩展到必须灵活假设对象结构的像素渲染环境。我们介绍OPINE-World——从交互在线学习以对象为中心的程序化世界模型的LLM智能体。OPINE-World将两个协作智能体耦合成假设-测试循环:一个在环境中行动——一个以代码合成模型(带重放验证与基于模型的规划)——并以我们称为本体误差的贝叶斯对象类型充分性度量引导探索。我们在ARC-AGI-3上评估OPINE-World——该基准衡量技能获取效率——对象词表、目标与动作语义均不告知。OPINE-World在无逐游戏训练的情况下解出25局中的20局——相对人类基线达到78.4的动作效率分。

OPINE-World:以本体错误优先交互探索的程序化世界建模:论文配图
图 1:OPINE-World 循环。目标导向代理在实时游戏中行动,并将每个转换记录在共享缓冲区中。世界模型代理从缓冲区重写一个以对象为中心的程序,并且只有当该程序准确地再现每个记录的转换时才被允许。清除一个级别后,规划器会搜索已承认的模型,并且每次执行其计划,任何不匹配都会将反例返回到缓冲区。本体误差 etat\eta_{t} 引导智能体接下来看的地方,并且定期批评家挑战拟合模型。