论文

X-Tree:标记可重用经验以实现高效Agent泛化

X-Tree: Tokenizing Reusable Experience for Efficient Agent Generalization

模型训练强化学习RLVRAgentic RL

摘要

多步Agent在平面动作流上进行训练:SFT 和 RLVR 统一对每个标记进行加权,并忽略跨任务重复出现的子过程,这种层次结构使人类可以从可重用例程中自上而下地进行计划。这种结构未被使用,并且平坦训练对每个稀有轨迹的利用程度低于其内容所允许的程度。最近的智能体确实使用了这种结构,但只是在上下文中作为LLM编写的技能,而不是在权重中,因此他们的收益不会推广到检索之外。相反,我们从数据本身恢复这个层次结构并对其进行训练,没有 LLM 调用。遵循文本分词器(仅通过计数来构建词汇表),我们通过可重用性对动作跨度进行评分,并将规范化动作合并到可重用的体验树(X-Tree)中。每个 X-Tree 节点都捕获了频繁且成功的技能如何由子技能组成,从而指导有效的泛化。我们将 X-Tree 集成到三种训练设置中:离线 RL,每个节点作为训练实例;在线 RLVR,具有自适应技能加成;以及按策略自我蒸馏,以 X-Tree 作为自学者的特权上下文。在 WebArena、ScienceWorld 和 WebShop 的三个模型规模上,X-Tree 在匹配的数据和预算下比标准配方进行了改进,WebArena 上的 SR 提高了 4.5%,ScienceWorld 上的 SR 提高了 5.8%,WebShop 上的成功率提高了 4.1%。匹配分析将收益归因于 X-Tree 结构和三个集成。