论文

State2State:LLM 代理的环境衍生中期训练

State2State: Environment-Derived Mid-Training for LLM Agents

模型训练合成数据

摘要

训练 LLM 代理通常依赖于来自专家轨迹的监督 微调 或使用手工验证器对人类指定任务进行的在线强化学习。虽然有效,但两者仍然受到外部指定任务和监督信号的瓶颈,限制了代理训练的可扩展性和多样性。我们研究了一种环境学习范式,其中代理仅通过环境交互来获取交互和操作能力,而不需要外部指定的任务。我们提出了 State2State,一种源自环境的中期训练方法,可将探索的环境状态转换为训练目标,挑战智能体达到指定的目标状态。通过从环境探索中派生任务并通过基于规则的状态匹配验证成功,State2State 提供了可扩展且可验证的训练目标,无需专家监督或手动任务设计。 ALFWorld 和 ScienceWorld 上的实验表明,在大多数设置中,State2State 作为独立的环境学习阶段可以提高代理性能。作为下游强化学习的初始化,它进一步提高了最终性能和学习效率,并具有跨环境泛化的有希望的证据。