论文
获取、修复、保存:小型对话游戏代理的诊断引导 后训练 配方
Acquire, Repair, Preserve: A Diagnosis-Guided Post-Training Recipe for Small-Model Dialogue Game Agents
摘要
交互式对话游戏测试了静态基准在很大程度上隐含的能力:模型必须跨回合携带状态、解释反馈并在不断变化的约束条件下选择有效的操作。我们使用 2B 开放权重模型在 LM Playschool Challenge 中研究了这一设置,发现许多失败不仅是广泛的知识失败,而且是局部决策失败:重复猜测、畸形动作以及违反模型刚刚看到的反馈。这些诊断激发了围绕三个步骤组织的训练方案:通过受监督的 微调 获得广泛的游戏参与,使用回合本地偏好对修复一个目标对话游戏系列中可机械验证的故障,并保留这些对话游戏之外的一般功能。在官方最终评估中,我们提交的内容将公共 clemscore 从 10.67 提高到 38.92,将封闭域内得分从 13.41 提高到 41.17,同时大致保持总体静态性能(基线为 44.14 vs. 44.24)。域外 clemscore 仍然很低,为 7.88,最大的收益集中在目标家族的未见过的变体中。我们的结果表明,广泛的 SFT 带来了模型的大部分能力改进;当故障检测准确且观察到的转移主要集中在家庭内部时,转移本地监督可能会很有效。