论文

MindGames Arena泛化赛道:采用延迟逐步奖励归因的In2AI方案

MindGames Arena Generalization Track: In2AI Solution with Delayed Per-Step Reward Attribution

模型训练强化学习

摘要

训练语言模型智能体进行多智能体策略交互存在一个核心困难:任一动作的质量可能取决于从未实现的未来事件、违反游戏规则的着法,或由其他玩家做出的决策。标准强化学习假设奖励可以在每一步被分配,但在结果在时间与智能体之间相互纠缠的情境中,这一假设并不成立。我们提出带资格门控的延迟逐步奖励归因,一种episode生命周期与后处理流水线:只在episode结束时计算奖励,根据任务特定语义将其回传到起因步骤,并将缺乏有效依赖信息的步骤排除在训练之外。结合通过vLLM连续批处理实现的异步rollout生成、基于课程的对手采样以及多层级分层批次构建,该方法使多智能体环境中的强化学习训练稳定且样本高效。我们在NeurIPS 2025的MindGames Arena基准上进行评估:用该方法训练的单一80亿参数开源模型在对战中与包括GPT-5在内的规模大得多的专有系统打平或超越,并在Open(无限制)与Efficient(不超过8B参数)两个赛道均获第一名。

MindGames Arena泛化赛道:采用延迟逐步奖励归因的In2AI方案:论文配图
图 2:系统架构概览。 vLLM 异步引擎(Kwon 等人,2023)通过具有数据并行工作器和连续批处理的 API 服务器来服务推理请求,以便工作器无需相互等待(挑战 4.8)。 Rollout Provider 查询 vLLM 以运行并发剧集工作人员;每个槽都包含动作验证器和剧集后处理管道,它通过向后归因计算延迟奖励并过滤缺乏信号的步骤(挑战 4.1、4.2、4.5);采样器强制执行平衡的位置覆盖和基于课程的对手选择(挑战 4.3、4.4)。已完成的剧集流向 Rollout Builder,后者将它们聚合到剧集库中,应用奖励分层和环境平衡,并将每个等级的小批量队列构建为全局训练批次(挑战 4.6、4.7)。强化学习训练器使用留一基线和每个环境优势标准化来优化策略,然后通过回调将更新的权重同步回 vLLM。