论文
临时组队任务中上下文内强化学习的极限基准测试
Benchmarking the Limits of In-Context Reinforcement Learning for Ad-Hoc Teamwork
摘要
上下文内强化学习(ICRL)已使基础智能体能够即时适应新任务,但其在需要与未知伙伴协作的临时组队(Ad-Hoc Teamwork, AHT)中的效果仍属空白。为严格评估这一点,我们提出大规模基准ICRL4AHT,其构建于Overcooked-V2的高吞吐JAX实现之上。该基准包含一个覆盖RL策略与启发式策略的大型多样化队友套件,支持可控的训练—测试偏移,并提供从队友生成、学习历史收集、数据集构建到在线多回合评估的可复现端到端流水线。我们在数百万转移上评估了代表性的历史条件化ICRL算法,包括Algorithm Distillation(AD)和Decision-Pretrained Transformer(DPT)。结果揭示了显著的局限:与它们在单智能体领域的成功相反,这些基线在多智能体环境中无法表现出稳健的测试时适应。具体而言,这些方法在未见队友和未见布局两条赛道上都常常不及随机基线,且在长时程中没有清晰的上下文内改进。这些发现凸显了OvercookedV2 AHT协议下部分可观测环境中策略性推断的挑战,也确立了该基准作为下一代协作算法关键试验场的地位。
