论文
基于 RL 的 LLM 智能体后训练的显式轨迹多样性
Explicit Trajectory Diversity for RL-Based Post-Training of LLM Agents
摘要
LLM Agent通常承认同一任务有多种高质量的解决方案,但推理结构、工具使用模式或交互轨迹各不相同。然而,大语言模型训练后的现有多样性概念大多是隐含的,源于一般随机性和正则化机制,而不是明确针对与任务相关的行为变化。虽然这种隐含的多样性可能很有用,但它并没有直接指定对于给定的任务应该鼓励哪种形式的行为变化。在这项工作中,我们研究了大语言模型基于强化学习的后训练中的显式轨迹多样性。我们的关键思想是通过用户指定的、特定于任务的轨迹描述符来定义多样性,该描述符将每个采样轨迹映射到可解释的行为表示,然后将多样性测量为结果描述符矩阵上的集合级函数。在此基础上,我们引入了轨迹引导联合策略优化(TJPO),这是一个单一策略框架,可优化采样轨迹组的显式多样性,避免基于人口的策略训练的需要,并通过轨迹级学习信号在基于组的策略优化中实例化它。这种设计使得多样性目标既可解释又可控制。 Sokoban 和 ALFWorld 上的实验表明,TJPO 提高了特定任务的轨迹多样性,同时保持了有竞争力的任务性能。描述符和轨迹分析表明,学习到的变化遵循指定的行为维度,并包括不同的成功策略。额外的实验结果表明,明确塑造轨迹多样性可以帮助 LLM 智能体满足用户需求,并在任务条件发生变化时保持有效。