论文

迈向可扩展的可验证奖励:面向多轮工具调用 LLM 智能体的代理状态评估

Toward Scalable Verifiable Reward: Proxy State-Based Evaluation for Multi-turn Tool-Calling LLM Agents

智能体系统Agent任务评测长程任务评测

摘要

通过多轮对话和多步工具调用运作的交互式大语言模型(LLM)智能体在生产中日益普及。此类智能体的基准既要可靠比较模型,又要产出在策略训练数据。既有 Agentic 基准如 tau-bench、tau^2-bench 和 AppWorld 依赖完全确定性的后端,构建与迭代成本高。我们提出 Proxy State-Based Evaluation,一个由 LLM 驱动的模拟框架,在没有确定性数据库的情况下保留基于最终状态的评估。具体地,场景指定用户目标、用户/系统事实、期望最终状态和期望智能体行为,LLM 状态跟踪器从完整交互轨迹推断结构化代理状态。LLM 裁判随后依据场景约束核验目标完成情况并检测工具/用户幻觉。实证上,我们的基准跨模型家族与推理时思考力度产生稳定、能区分模型的排名,其在策略/离策略 rollout 提供可迁移到未见场景的监督。细致的场景设定带来接近零的模拟器幻觉率,消融研究支持这一点。该框架还支持对用户人设的敏感性分析。人类与 LLM 裁判的一致率超过 90%,表明自动评估可靠。总体而言,代理状态评估为工业 LLM 智能体提供了确定性 Agentic 基准之外的实用、可扩展替代。

迈向可扩展的可验证奖励:面向多轮工具调用 LLM 智能体的代理状态评估
图1:基于代理状态(proxy state)的评估基准概览。在多轮交互中,基于LLM的用户模拟器与推理智能体对话,后者规划并执行对基于LLM的工具模拟器的多步工具调用。经人类专家校准的LLM裁判通过检查最终代理状态来判断目标是否完成。该基准1)评估推理智能体通过多轮对话与工具调用达成目标的能力,2)产出带奖励的对话数据,并支持用于比较推理智能体的排行榜。