论文
TSR:面向LLM智能体多轮强化学习的轨迹搜索采样
TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents
摘要
大语言模型 (LLM) 的进步正在推动使用强化学习 (RL) 的转变,通过跨任务的迭代、多轮交互来训练智能体。然而,多轮强化学习仍然具有挑战性,因为奖励往往稀疏或延迟,而且环境可能是随机的。在这种情况下,朴素的轨迹采样可能会阻碍开发并导致模式崩溃。我们提出了 TSR(轨迹搜索推出),这是一种训练时间方法,它重新利用测试时间缩放思想来改进每轮推出生成。 TSR 执行轻量级树式搜索,通过使用特定于任务的反馈在每个回合选择高分动作来构建高质量的轨迹。这提高了推出质量并稳定了学习,同时保持底层优化目标不变,从而使 TSR 与优化器无关。我们使用 best-of-N、beam 和浅层前瞻搜索来实例化 TSR,并将其与 PPO 和 GRPO 配对,在训练计算量一次性增加的情况下,在 Sokoban、FrozenLake 和 WebShop 任务上实现高达 15% 的性能提升和更稳定的学习。通过将搜索从推理时间转移到训练的推出阶段,TSR 提供了一种简单而通用的机制,可实现更强的多轮代理学习,对现有框架和拒绝采样式选择方法进行补充。
