论文

$π$-Play:通过特权自我 蒸馏 进行多代理自我游戏,无需外部数据

$π$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External Data

摘要

深度搜索代理已成为解决复杂信息搜索任务的有前途的范例,但由于奖励稀疏、贡献分配薄弱和标记数据有限,它们的训练仍然具有挑战性。自我对弈提供了一种可扩展的途径来减少数据依赖,但传统的自我对弈只能通过稀疏的结果奖励来优化学生,导致学习效率低下。在这项工作中,我们观察到自我对弈在任务生成过程中自然地产生了一个问题构建路径(QCP),这是一个捕获逆向解决过程的中间工件。这揭示了特权信息的新来源:自我对弈可以以低成本和大规模为自我 蒸馏 提供高质量的特权信息,而不依赖于人类反馈或策划的特权信息。利用这一见解,我们提出了特权信息自我博弈($π$-Play),这是一种结合自我博弈和自我 蒸馏 的新型多智能体自我进化框架。在 $π$-Play 中,考官与 QCP 一起生成任务,教师使用 QCP 作为特权上下文,通过自我 蒸馏 密集监督学生。这种设计将稀疏奖励的自我博弈转变为密集反馈的共同进化。大量实验表明,无数据 $π$-Play 超越了完全监督的搜索代理,并且比传统的 self-play 提高了 2-3$\times$ 的进化效率。代码可在 https://github.com/zhyaoch/pi-play 获取。