论文

首先让它可玩,然后让它变得更好:小型对话游戏代理的分阶段交互学习

First Make It Playable, Then Make It Good: Staged Interaction Learning for Small Dialogue-Game Agents

模型训练监督微调与指令调优

摘要

我们提出了 Qwen-GuidePlay-2B,一种用于对话游戏交互的 2B 参数语言模型。我们使用三个步骤对 Qwen3.5-2B 进行微调:a) 仅在 Playpen 的成功游戏轨迹上进行 SFT,b) 加权回合级别 SFT,以及 c) 教师指导的 SFT。教师模型(这是一个更大的模型)仅用于修复格式和评估示例,但不会创建新的标准操作。我们的最终模型在公共 Playpen 验证中得分为 57.12 clemscore 和 42.68 statscore。在正式发布的挑战结果中,我们的模型在提交的系统中获得了第二高的 Playpen clemscore delta(比其基本模型大约+36)。我们的研究结果表明,模仿完整的轨迹有助于提高可玩性,而回合和教师指导的训练通常可以改善决策并提高总体分数。重放修复和困难示例挖掘等其他程序繁重的方法并没有帮助,这表明小型模型只需使用仔细的管理策略而不是激进的更改即可实现高性能。我们提供模型和代码以实现可重复性。