论文

临时组队任务中上下文内强化学习的极限基准测试

Benchmarking the Limits of In-Context Reinforcement Learning for Ad-Hoc Teamwork

模型评测基准与评测资源

摘要

上下文内强化学习(ICRL)已使基础智能体能够即时适应新任务,但其在需要与未知伙伴协作的临时组队(Ad-Hoc Teamwork, AHT)中的效果仍属空白。为严格评估这一点,我们提出大规模基准ICRL4AHT,其构建于Overcooked-V2的高吞吐JAX实现之上。该基准包含一个覆盖RL策略与启发式策略的大型多样化队友套件,支持可控的训练—测试偏移,并提供从队友生成、学习历史收集、数据集构建到在线多回合评估的可复现端到端流水线。我们在数百万转移上评估了代表性的历史条件化ICRL算法,包括Algorithm Distillation(AD)和Decision-Pretrained Transformer(DPT)。结果揭示了显著的局限:与它们在单智能体领域的成功相反,这些基线在多智能体环境中无法表现出稳健的测试时适应。具体而言,这些方法在未见队友和未见布局两条赛道上都常常不及随机基线,且在长时程中没有清晰的上下文内改进。这些发现凸显了OvercookedV2 AHT协议下部分可观测环境中策略性推断的挑战,也确立了该基准作为下一代协作算法关键试验场的地位。

临时组队任务中上下文内强化学习的极限基准测试:论文配图
图 1:基准管道概述 (ICRL4AHT)。 (1) 基准清单指定布局、任务和其他属性,并定义两个评估轨道,以消除对队友和布局的概括。 (2) 一个多样化的队友策略池是由强化学习训练的策略和启发式策略构建的,其中队友策略 π−i\pi^{-i} 可以被采样用于训练或测试。 (3) 使用 OvercookedV2 布局,RL 自我代理和采样的队友策略之间的交互被推出并记录为学习历史。 (4) 收集的数据被打包成分块的 HDF5 数据集,具有情节/任务索引、快速元数据查询和预取/缓存支持,为 ICRL 训练提供高效的上下文窗口批量采样。 (5) ICRL 学习者接受数据集训练,然后 (6) 在线评估两个轨道下的测试时适应情况,报告适应曲线等指标。