论文

从代理经验中进行样本高效学习

Sample-Efficient Learning from Agent Experience

摘要

现实世界的代理学习通常受到成本高昂的环境交互的限制,例如运行耗时的实验或获取人类反馈。上下文学习为代理从自己的交互历史中学习提供了一种高度样本有效的方法,但一旦将经验从上下文中删除,它的收益就会消失。另外,上下文 蒸馏 提供了一种将上下文信息内化到模型权重中的机制。然而,在不牺牲环境样本效率的情况下将其应用于代理的交互历史仍有待探索。我们将此问题称为“体验”蒸馏,并开发一种实现,除了收集的体验之外,不需要进一步的环境交互。对 749 个策划的软件工程任务和 6 个文本冒险游戏的实验表明,它保留了跨两个领域的上下文学习的至少 64.8% 的收益,而对收集的经验进行直接监督的 微调 仅恢复了 3.8%。与经典的强化学习基线相比,从试错经验中进行的上下文学习以及经验 蒸馏 的性能与至少\(9.6\倍\)更少的环境样本相匹配。