论文
通过规划对齐智能体:一个轨迹级奖励建模基准
Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling
摘要
在经典的人类反馈强化学习(Reinforcement Learning from Human Feedback, RLHF)中,奖励模型(Reward Model, RM)是模型对齐的基础信号提供者。随着大语言模型演化为能够自主调用工具并进行复杂推理的智能体系统,奖励建模范式面临前所未有的挑战——其中最突出的是,缺乏专门用于评估RM在工具集成环境中能力的基准。为填补这一空白,我们提出Plan-RewardBench,一个轨迹级偏好基准,旨在评估评判器在复杂工具使用场景中区分偏好智能体轨迹与干扰性智能体轨迹的能力。Plan-RewardBench涵盖四个代表性任务族——(i) 安全拒绝、(ii) 工具无关/不可用、(iii) 复杂规划、(iv) 鲁棒错误恢复——由经过验证的正轨迹以及通过多模型自然rollout、基于规则的扰动和最小编辑LLM扰动构造的易混淆难负例组成。我们在统一的成对比较协议下对代表性RM(生成式、判别式和LLM-as-Judge)进行基准测试,报告不同轨迹长度和任务类别下的准确率趋势。此外,我们对普遍存在的失败模式提供诊断分析。我们的结果显示,三类评估器家族都面临重大挑战,在长程轨迹上性能急剧下降,凸显了对智能体轨迹级奖励建模进行专门训练的必要性。最终,Plan-RewardBench旨在既作为实用的评估套件,也作为构建智能体规划偏好数据的可复用蓝图。
