论文

将游戏代码世界模型生成能力蒸馏进轻量大语言模型

Distilling Game Code World Model Generation into Lightweight Large Language Models

模型优化模型训练强化学习小模型/轻量模型RLVR

摘要

大语言模型(LLM)已展现出从自然语言生成可执行代码的强大能力,为自动构建AI智能体环境开辟了可能。关于代码世界模型(CWM)的最新研究表明,LLM可以将游戏规则翻译成与蒙特卡洛树搜索等求解器兼容的Python实现。我们在游戏场景中研究这一问题,此时生成的环境必须实现规则、合法动作、状态转移、观测和奖励。我们将这类游戏特定的可执行模型称为游戏代码世界模型(GameCWM)。然而,当前的代码世界模型生成方法依赖前沿模型和推理时精炼循环,限制了可及性与可扩展性。本工作研究GameCWM生成能力能否通过后训练蒸馏到更小的模型中。我们引入:(1) 一个精选的30个游戏数据集,涵盖完全信息与不完全信息游戏;(2) 一个依据游戏结构与语义属性评估生成代码的验证框架;(3) 一个结合监督微调(SFT)与可验证奖励强化学习(RLVR)的后训练流水线。我们在Qwen2.5-3B-Instruct上实验,发现SFT可以提高语法正确性,而RLVR能改进执行层面对游戏规则的遵循,从而提升Qwen在完全信息与不完全信息两类游戏中生成有效GameCWM的能力。总体而言,我们的流水线使Qwen2.5-3B-Instruct更擅长生成有效的GameCWM,为从自然语言自动生成环境提供了一条可扩展的路径。

将游戏代码世界模型生成能力蒸馏进轻量大语言模型:论文配图
图 1.我们的蒸馏管道。与广泛依赖测试时计算的先前方法不同,我们的目标是通过后期训练将博弈论逻辑提炼为模型权重。与许多 LLM 流程一样,我们的流程涉及两个阶段:监督微调 (SFT),然后是使用 GRPO 的 RLVR。为了实现我们的方法,我们定义了一个在 SFT 期间使用的提示代码对数据集,以及一个用于自动评估生成代码的分层验证框架,该框架提供奖励信号,增强 RLVR 期间生成的 GameCWM 的语法正确性和语义有效性。