论文

通过规划对齐智能体:一个轨迹级奖励建模基准

Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling

模型评测智能体系统Agent任务评测基准与评测资源长程任务评测

摘要

在经典的人类反馈强化学习(Reinforcement Learning from Human Feedback, RLHF)中,奖励模型(Reward Model, RM)是模型对齐的基础信号提供者。随着大语言模型演化为能够自主调用工具并进行复杂推理的智能体系统,奖励建模范式面临前所未有的挑战——其中最突出的是,缺乏专门用于评估RM在工具集成环境中能力的基准。为填补这一空白,我们提出Plan-RewardBench,一个轨迹级偏好基准,旨在评估评判器在复杂工具使用场景中区分偏好智能体轨迹与干扰性智能体轨迹的能力。Plan-RewardBench涵盖四个代表性任务族——(i) 安全拒绝、(ii) 工具无关/不可用、(iii) 复杂规划、(iv) 鲁棒错误恢复——由经过验证的正轨迹以及通过多模型自然rollout、基于规则的扰动和最小编辑LLM扰动构造的易混淆难负例组成。我们在统一的成对比较协议下对代表性RM(生成式、判别式和LLM-as-Judge)进行基准测试,报告不同轨迹长度和任务类别下的准确率趋势。此外,我们对普遍存在的失败模式提供诊断分析。我们的结果显示,三类评估器家族都面临重大挑战,在长程轨迹上性能急剧下降,凸显了对智能体轨迹级奖励建模进行专门训练的必要性。最终,Plan-RewardBench旨在既作为实用的评估套件,也作为构建智能体规划偏好数据的可复用蓝图。

通过规划对齐智能体:一个轨迹级奖励建模基准
图 1:Plan-RewardBench 概述。 (左)评估范围。 RewardBench 仅评估最终响应,而 FC-RewardBench 侧重于工具调用名称/参数;两者都可能会错过基于工具的矛盾(例如,与工具输出相矛盾的流畅答案)。 (右)施工管道。我们从 Toucan/MCP 获取任务和工具环境,通过自然推出和扰动扩展候选者,通过元审查和人工审核进行多评判评分,并组装难度/偏差控制的偏好对以进行轨迹级评估和训练。