论文
OPINE-World:以本体错误优先交互探索的程序化世界建模
OPINE-World: Programmatic World Modeling with Ontology-error-Prioritized Interactive Exploration for ARC-AGI-3
摘要
从交互中学习环境如何运作是构建能适应陌生任务智能体的核心。深度网络学得的世界模型灵活但耗数据——且在训练分布外迁移差。程序合成的世界模型——由LLM写成源代码——并经反例引导归纳综合(CEGIS)精化——则数据高效且可复用——但此前主要在给定对象词表的结构化状态世界上演示——单一程序搜索无法扩展到必须灵活假设对象结构的像素渲染环境。我们介绍OPINE-World——从交互在线学习以对象为中心的程序化世界模型的LLM智能体。OPINE-World将两个协作智能体耦合成假设-测试循环:一个在环境中行动——一个以代码合成模型(带重放验证与基于模型的规划)——并以我们称为本体误差的贝叶斯对象类型充分性度量引导探索。我们在ARC-AGI-3上评估OPINE-World——该基准衡量技能获取效率——对象词表、目标与动作语义均不告知。OPINE-World在无逐游戏训练的情况下解出25局中的20局——相对人类基线达到78.4的动作效率分。
