论文
迈向更好的多轮用户交互Agent:下一轮用户输入不只是上下文
Towards Better Agents for Multi-Turn User Interaction: The Next User Turn Is More Than Context
摘要
面向用户的工具Agent必须随用户目标在多轮中展开而协调对话与工具使用。然而,交互式强化学习通常把每个rollout压缩为单一终端奖励,把同等信用分配给有效的引导提问、错误以及随后的补救。下一轮用户输入不只是上下文:它还提供了关于前一个用户-用户片段的带噪、时间上局部的证据。我们提出反馈感知信用分配(FACA),把每个反应与该片段对齐,推导局部归一化的反应优势,并将其叠加到经过验证的终端结果优势上,且不需要额外的critic或rollout。与在模拟器、可见对话、初始化、rollout和优化上均对齐的仅结果交互式GRPO对照相比,FACA在三次独立训练中将九域τ族平均在8B和14B上分别提升5.91和10.22个百分点。收益集中在Telecom域;在8B下,随机化反应极性会消除Telecom收益。同样的排序在Pare-Bench和Co-Gym上零样本成立。这些结果表明,下一轮用户反应为改进多轮用户交互Agent提供了可操作的局部信用。
