论文

世界Agent:语言模型能否维持世界运转?

World Agent: Can Language Models Keep a World Running?

智能体系统Agent任务评测

摘要

世界模型正在从生成真实的框架转向生成可玩的世界,但交付的世界是否可以继续运行还没有在任何地方进行测试。现有的评估在生成、交付或单步转换时停止,并且每次评估都停止在沿途的不同点。正确的局部状态转换或中间结果并不能保证正确组织的因果事件流。我们提出了世界Agent任务,将世界生成的评估点从交付时刻转移到随后的持续运行。在此任务中,不要求模型生成世界。它负责维持世界的运转,这需要协调事件并推进其后果以限制随后的演变。我们使用两个互补的轨道在 WorldAgent-Benchmark 中实例化该任务。在维护轨道中,模型必须将连续叙述的事件转化为显式世界状态的正确转换,同时尊重因果、时间和并发约束。在推演轨道中,模型必须预测世界在部分观察下将如何演变,并朝着某个目标采取行动。维护轨道将LLM辅助的语义判断与程序化验证和评分相结合,而演绎轨道则完全以程序化方式进行评估。单个判断可以根据世界状态和执行日志进行审核,并且可以根据保存的判断和执行记录重新计算分数。在 8 个模型中,随着预先构建的结构从世界中消失,分数稳步下降,而因果关系检查是每个模型中最薄弱的部分。该基准使世界的持续运行变得可衡量,并将局部完成与事件组织中的失败区分开来。代码和数据集将在https://github.com/HCPLab-SYSU/WorldAgent-Benchmark.上发布