VETTA:协调多轮 Agent 的轮次与词元信用分配
VETTA: Coordinating Turn- and Token-Level Credit Assignment for Multi-Turn LLM Agents
摘要
多轮 LLM 智能体通常会在多次交互中接收稀疏任务反馈,同时通过 token 生成每个响应 token。这就产生了两个相关的信用分配问题:哪些响应有助于实现结果,以及每个响应中哪些生成结果决策很重要?现有的方法通常只关注一个级别:回合级别方法评估完整的响应,但不区分其中的决策; token 级方法可以跨回合传播反馈,但不会明确为每个响应建模信用。这些互补的限制激发了两个级别的学习学分,并在单个策略更新中对其进行协调。我们引入了 VETTA,一种信用分配方法,通过共享轻量级批评家的单独头来共同学习回合和 token 级别的值。 VETTA 沿两个时间序列计算优势,并将每个回合优势与以响应内为中心的 token 残差相结合,以进行 PPO 更新。此外,为了降低价值学习成本,批评者仅保留用于初始化 执行模型 的预训练检查点中的早期 Transformer 块。在两个具有挑战性的智能体基准测试(ALFWorld 和 WebShop)上,VETTA 使用 Qwen2.5-1.5B-Instruct 分别比 PPO 提高了 37.5% 和 22.3% 的成功率,使用 Qwen2.5-7B-Instruct 分别实现了 95.5% 和 76.0% 的成功率。批评者深度比较进一步显示出强大的任务性能,而批评者端的计算量却大大降低。这些结果表明,紧凑的共享批评家可以协调回合级和 token 级的信用,以提高智能体的性能,同时保持价值估计的效率。代码可在 https://github.com/Jiaju-Chen/VETTA-official. 获取
