论文
Stratagem:通过轨迹调制的游戏自博弈学习可迁移推理
Stratagem: Learning Transferable Reasoning via Trajectory-Modulated Game Self-Play
摘要
游戏为培养语言模型的通用推理能力提供了一个极具吸引力的范式,因为它们天然要求战略规划、概率推断与自适应决策。然而,现有的自博弈方法仅依赖终局游戏结果,没有任何机制来区分可迁移的推理模式与游戏特定的启发式。我们提出STRATAGEM,应对推理迁移的两大根本障碍:领域特异性——习得模式仍锚定在游戏语义上;以及情境静止——静态游戏环境无法培养渐进式推理。STRATAGEM通过推理可迁移性系数(Reasoning Transferability Coefficient)选择性地强化那些展现抽象、领域无关推理的轨迹,同时通过推理演化奖励(Reasoning Evolution Reward)激励自适应推理的发展。在数学推理、通用推理与代码生成基准上的实验显示出显著改进,在多步推理至关重要的竞赛级数学上收益尤为突出。消融研究与人工评估确认两个组件都对可迁移推理有所贡献。