论文

IGMWorld可执行世界编辑基准

World Editing: Intervening on Executable Worlds at Increasing Depth

智能体系统Agent任务评测长程任务评测

摘要

交互式世界模型日益能生成环境并在其中行动,但对既有可执行世界做有意编辑仍少被研究。我们把世界编辑形式化为在保留应保持属性的前提下干预既有世界,并引入"干预深度"轴,描述一次编辑把世界实体、动力学与系统耦合得多紧。我们通过工业级游戏Modding实例化该能力,提出IGMWorld与IGMBench——覆盖Minecraft与Terraria的110个任务、超过1100条可执行状态与行为判据。任务横跨属性、实体、动力学与系统干预,通过确定性可执行性、行为、保留与视觉检查评估。前沿编码智能体已表现出可观的世界编辑能力:最强配置在严格任务级判据下解决78.2%的任务,判据级性能达94.8%。可靠性随干预深度增加普遍下降,这一模式在判据数相近的任务之间依然存在。多数失败编辑仍能构建并加载,说明主要困难是让编辑后的世界按请求运行。视觉一致性是另一短板,所有受评配置的联合视觉通过率低于50%。这些结果表明世界编辑是不同于世界生成与交互的独立能力,可执行游戏为其提供了实用试验床。