论文

CAST:游戏解算者担任 LLM 特工的回合级教师

CAST: Game Solvers as Turn-Level Teachers for LLM Agents

模型训练奖励建模与过程监督

摘要

训练 大语言模型 (LLM) 在长期博弈中采取行动是迈向通才决策的有希望的一步,但具有可验证奖励的强化学习 (RLVR) 依赖于稀疏的最终奖励,而这些奖励很少揭示哪些决策决定成功。更密集的过程信号可以弥补这一缺失的转级信用,但现有的信号源很难保持既便宜又准确。我们观察到游戏求解器状态值的变化揭示了某个动作是否会推动状态走向成功。基于这一见解,我们提出了 CAST(求解器教师的信用分配),它将这些值变化转换为求解器优势,并将其作为回合级信号注入 RLVR。我们进一步表明,在软最优求解器假设下,最大化求解器优势相当于求解器中的 同策略 蒸馏,仅需要标量值而不是教师 logits。在《推箱子》、《扫雷》和《Rush Hour》中,CAST 在域内和未见难度评估下的每款游戏中的表现都优于所有经过训练的基线,并在 ALFWorld 和 WebShop 上实现了最高的平均零射击性能。我们的代码可在 https://github.com/Wloner0809/CAST 获取。