论文

用于 StarCraft II 策略精炼的世界模型

World Models for Policy Refinement in StarCraft II

智能体系统Agent 规划

摘要

大语言模型(LLM)最近表现出强大的推理和泛化能力,促使它们在复杂环境中用作决策策略。星际争霸 II (SC2) 具有巨大的状态动作空间和部分可观测性,是一个具有挑战性的测试平台。然而,现有的基于 LLM 的 SC2 智能体主要侧重于改进策略本身,而忽略了将可学习的、以行动为条件的转换模型集成到决策循环中。为了弥补这一差距,我们提出了 StarWM,这是 SC2 的第一个世界模型,可以在部分可观测性下预测未来的观测结果。为了促进学习 SC2 的混合动力学,我们引入了一种结构化文本表示,将观察结果分解为五个语义模块,并构建了 SC2-Dynamics-50k,这是第一个用于 SC2 动力学预测的指令调整数据集。我们进一步开发了一个用于预测结构化观察的多维离线评估框架。离线结果显示,StarWM 较零样本基线有大幅提升,包括资源预测精度和自身宏观情况一致性方面提高了近 60%。最后,我们提出了 StarWM-Agent,这是一个世界模型增强决策系统,它将 StarWM 集成到生成-模拟-细化决策循环中,以实现前瞻驱动的政策细化。针对 SC2 内置 AI 的在线评估显示出持续的改进,相对于 Hard (LV5)、Harder (LV6) 和 VeryHard (LV7) 胜率分别提高了 30%、15% 和 30%,同时改善了宏观管理稳定性和战术风险评估。

用于 StarCraft II 策略精炼的世界模型
图1:将我们的世界模型增强决策系统(StarWM-Agent)与不使用世界模型的策略进行对比的案例研究。在当前观测下,LLM策略最初提出Build Supply Depot。世界模型5秒的rollout预测矿物将降至50、补给站完成度为23%,而未使用的补给仍为18。基于这一预测,系统将动作改为Train SCV,避免了会导致矿物短缺的过早基础设施支出。此例说明,引入世界模型可以改善宏观管理决策。