论文
多轮 LLM Agent的非对称 Actor-Critic
Asymmetric Actor-Critic for Multi-turn LLM Agents
摘要
大语言模型 (LLM) 表现出强大的推理和会话能力,但确保多轮交互中的可靠行为仍然具有挑战性。在许多实际应用中,代理必须在不可能重试的一次性设置中取得成功。现有方法要么依赖于反射或事后评估(这需要额外的尝试),要么假设完全可训练的模型无法利用专有的 LLM。我们为可靠的对话代理提出了一个不对称的Actor–Critic框架。强大的专有 LLM 充当参与者,而较小的开源评判器提供运行时监督,监视参与者的行为并在同一交互轨迹内进行干预。与基于训练的Actor–Critic方法不同,我们的框架监督在开放式对话环境中操作的固定的执行Agent。该设计利用了生成验证的不对称性:虽然高质量的生成需要大型模型,但较小的模型通常可以实现有效的监督。我们进一步引入了一个数据生成管道,可以在不修改参与者的情况下为批评者 微调 生成监督信号。 $τ$-bench 和 UserBench 上的实验表明,与强大的单代理基线相比,我们的方法显着提高了可靠性和任务成功率。此外,轻量级开源批评家在批评家角色中可以与更大的专有模型相媲美或超越,并且批评家 微调 比几种最先进的方法产生了额外的收益。