论文
通过世界模型扩展自动研究代理
Scaling Automatic Research Agents via World Models
摘要
自动化实证研究是人工智能的一个长期方向。最近的自动研究(AutoResearch)代理使这一目标触手可及,因为现代 LLM 显示了独立实施解决方案并从执行结果中学习的能力。在这些收益的背后,后训练(尤其是 RL)发挥着核心作用。在本文中,我们确定了在扩展这些代理的 RL 时存在的一个基本矛盾:每个 AutoResearch 轨迹的两个组成部分(代理生成和环境执行)以非常不同的方式扩展,因为所有生成都通过批处理共享计算,而每个执行占用其专有的沙箱和真实机器时间。因此,环境执行在训练成本中占主导地位,并随着轨迹的增长而成为瓶颈。为了解决这种紧张关系,我们提出了世界模型强化学习(WMRL),它用世界模型代替环境执行来消除这个瓶颈。此外,世界模型可能是不完美的,因为它的奖励会被偏见和噪音破坏。因此,我们进一步为 WMRL 配备了两种缓解措施:在线去偏和逆方差去噪,分别抵消偏差和抑制噪声。从理论上讲,我们证明了 WMRL 的两种缓解措施都严格提高了收敛保证。根据经验,WMRL 将不同智能体规模的各种任务的训练速度提高了 3-4 倍,同时超过了标准 RL 基线的性能。此外,我们训练后的 4B 和 9B 智能体在测试基准上的表现优于更大的开放权重智能体 48B 和 120B。除了 AutoResearch 之外,WMRL 还转移到 后训练 体现的 VLA 策略,这证明了我们方法的通用性。