论文

VETTA:协调多轮 Agent 的轮次与词元信用分配

VETTA: Coordinating Turn- and Token-Level Credit Assignment for Multi-Turn LLM Agents

模型训练强化学习

摘要

多轮 LLM 智能体通常会在多次交互中接收稀疏任务反馈,同时通过 token 生成每个响应 token。这就产生了两个相关的信用分配问题:哪些响应有助于实现结果,以及每个响应中哪些生成结果决策很重要?现有的方法通常只关注一个级别:回合级别方法评估完整的响应,但不区分其中的决策; token 级方法可以跨回合传播反馈,但不会明确为每个响应建模信用。这些互补的限制激发了两个级别的学习学分,并在单个策略更新中对其进行协调。我们引入了 VETTA,一种信用分配方法,通过共享轻量级批评家的单独头来共同学习回合和 token 级别的值。 VETTA 沿两个时间序列计算优势,并将每个回合优势与以响应内为中心的 token 残差相结合,以进行 PPO 更新。此外,为了降低价值学习成本,批评者仅保留用于初始化 执行模型 的预训练检查点中的早期 Transformer 块。在两个具有挑战性的智能体基准测试(ALFWorld 和 WebShop)上,VETTA 使用 Qwen2.5-1.5B-Instruct 分别比 PPO 提高了 37.5% 和 22.3% 的成功率,使用 Qwen2.5-7B-Instruct 分别实现了 95.5% 和 76.0% 的成功率。批评者深度比较进一步显示出强大的任务性能,而批评者端的计算量却大大降低。这些结果表明,紧凑的共享批评家可以协调回合级和 token 级的信用,以提高智能体的性能,同时保持价值估计的效率。代码可在 https://github.com/Jiaju-Chen/VETTA-official. 获取

VETTA:协调多轮 Agent 的轮次与词元信用分配:论文原图
图 2:VETTA 概述。 (a) 共同的批评者保留了早期预训练的 Transformer 块,并使用单独的头进行回合和 token 级别的值估计。 (b) 执行模型与环境交互以收集轨迹和奖励;价值估计支持优势计算,然后是批评回归和 PPO 策略更新。 (c) 在 GAE 的转弯和 token 级别查看收集的轨迹; token 的优势集中在每个响应中,并与其回合优势相结合。隐式后继值和优势在 执行轨迹 端设置为零。