论文
用于 StarCraft II 策略精炼的世界模型
World Models for Policy Refinement in StarCraft II
摘要
大语言模型(LLM)最近表现出强大的推理和泛化能力,促使它们在复杂环境中用作决策策略。星际争霸 II (SC2) 具有巨大的状态动作空间和部分可观测性,是一个具有挑战性的测试平台。然而,现有的基于 LLM 的 SC2 智能体主要侧重于改进策略本身,而忽略了将可学习的、以行动为条件的转换模型集成到决策循环中。为了弥补这一差距,我们提出了 StarWM,这是 SC2 的第一个世界模型,可以在部分可观测性下预测未来的观测结果。为了促进学习 SC2 的混合动力学,我们引入了一种结构化文本表示,将观察结果分解为五个语义模块,并构建了 SC2-Dynamics-50k,这是第一个用于 SC2 动力学预测的指令调整数据集。我们进一步开发了一个用于预测结构化观察的多维离线评估框架。离线结果显示,StarWM 较零样本基线有大幅提升,包括资源预测精度和自身宏观情况一致性方面提高了近 60%。最后,我们提出了 StarWM-Agent,这是一个世界模型增强决策系统,它将 StarWM 集成到生成-模拟-细化决策循环中,以实现前瞻驱动的政策细化。针对 SC2 内置 AI 的在线评估显示出持续的改进,相对于 Hard (LV5)、Harder (LV6) 和 VeryHard (LV7) 胜率分别提高了 30%、15% 和 30%,同时改善了宏观管理稳定性和战术风险评估。
