论文

GlyphBench:语言模型强化学习的游乐场

GlyphBench: A Playground for Language-Model Reinforcement Learning

智能体系统模型训练强化学习Agent 环境交互Agentic RL

摘要

我们引入了 GlyphBench,这是一个用于语言模型Agent强化学习 (RL) 后训练的环境套件,包含跨越不同游戏的 360 多个任务。 GlyphBench 将空间观测结果呈现为二维 Unicode 网格,并通过旨在支持高效和可重复研究的统一界面连接训练、评估和轨迹回放。我们使用 GlyphBench 来研究观察界面、推理工作和Agent Harness如何影响性能,以及 RL 配置如何塑造学习动态。我们的结果表明,在 Craftax 实验中,字形观察结果优于原生文本和像素,并且在几个 BALROG 环境中取得了进一步的进步。 100 个 GlyphBench 任务上的 RL 改进了 Qwen3.5-4B 在留出的Reasoning Gym问题上的表现,达到了 63.48% 的准确率,并且优于基础模型、数学训练的基线和代码训练的基线。这些实验提供了经验证据,表明从游戏玩法中获得的推理收益可以比数学或代码产生更强的迁移。总之,这些结果凸显了 GlyphBench 作为系统研究语言模型Agent如何学习、交互和泛化的测试平台的价值。