论文
MindGames Arena泛化赛道:采用延迟逐步奖励归因的In2AI方案
MindGames Arena Generalization Track: In2AI Solution with Delayed Per-Step Reward Attribution
摘要
训练语言模型智能体进行多智能体策略交互存在一个核心困难:任一动作的质量可能取决于从未实现的未来事件、违反游戏规则的着法,或由其他玩家做出的决策。标准强化学习假设奖励可以在每一步被分配,但在结果在时间与智能体之间相互纠缠的情境中,这一假设并不成立。我们提出带资格门控的延迟逐步奖励归因,一种episode生命周期与后处理流水线:只在episode结束时计算奖励,根据任务特定语义将其回传到起因步骤,并将缺乏有效依赖信息的步骤排除在训练之外。结合通过vLLM连续批处理实现的异步rollout生成、基于课程的对手采样以及多层级分层批次构建,该方法使多智能体环境中的强化学习训练稳定且样本高效。我们在NeurIPS 2025的MindGames Arena基准上进行评估:用该方法训练的单一80亿参数开源模型在对战中与包括GPT-5在内的规模大得多的专有系统打平或超越,并在Open(无限制)与Efficient(不超过8B参数)两个赛道均获第一名。
