论文

PhantomEnvironments:在虚构世界中训练大语言模型Agent

PhantomEnvironments: Training LLM Agents in Fictional Worlds

模型训练合成数据

摘要

使用强化学习 (RL) 训练 LLM Agent会受到环境的瓶颈,环境必须提供可验证的奖励、支持长期交互,并且扩展成本低廉。现有的方法依赖于昂贵的人工数据或大语言模型生成的环境,这些环境存在幻觉和基准污染的风险。我们表明,LLM 可以使用完全由规则生成的合成环境来训练为有能力的搜索Agent,其生成不需要 LLM 并且边际成本为零。我们构建了 PhantomEnvironments,即来自虚构世界的多回合 RL 环境,其中Agent必须搜索模板化文章的语料库来回答多跳问题。尽管不与现实世界分享任何事实,这些极其简单的环境产生的Agent可以转移到现实世界的多跳搜索基准,通常在新的基准上优于现实世界的训练数据。训练有素的智能体可以泛化到未见过的虚构宇宙,Qwen 模型学会了根据问题难度大致线性地调整其搜索预算,这表明仅从环境交互中即可进行紧急搜索扩展。消除环境复杂性表明,跳数驱动的传输不仅仅是约束或比较:即使是最简单的规则生成环境也是训练可推广 LLM Agent的令人惊讶的有效、免费资源。