论文
将游戏代码世界模型生成能力蒸馏进轻量大语言模型
Distilling Game Code World Model Generation into Lightweight Large Language Models
摘要
大语言模型(LLM)已展现出从自然语言生成可执行代码的强大能力,为自动构建AI智能体环境开辟了可能。关于代码世界模型(CWM)的最新研究表明,LLM可以将游戏规则翻译成与蒙特卡洛树搜索等求解器兼容的Python实现。我们在游戏场景中研究这一问题,此时生成的环境必须实现规则、合法动作、状态转移、观测和奖励。我们将这类游戏特定的可执行模型称为游戏代码世界模型(GameCWM)。然而,当前的代码世界模型生成方法依赖前沿模型和推理时精炼循环,限制了可及性与可扩展性。本工作研究GameCWM生成能力能否通过后训练蒸馏到更小的模型中。我们引入:(1) 一个精选的30个游戏数据集,涵盖完全信息与不完全信息游戏;(2) 一个依据游戏结构与语义属性评估生成代码的验证框架;(3) 一个结合监督微调(SFT)与可验证奖励强化学习(RLVR)的后训练流水线。我们在Qwen2.5-3B-Instruct上实验,发现SFT可以提高语法正确性,而RLVR能改进执行层面对游戏规则的遵循,从而提升Qwen在完全信息与不完全信息两类游戏中生成有效GameCWM的能力。总体而言,我们的流水线使Qwen2.5-3B-Instruct更擅长生成有效的GameCWM,为从自然语言自动生成环境提供了一条可扩展的路径。
