论文
超越标准:奖励建模的探索引导评估技巧
Beyond Rubrics: Exploration-Guided Evaluation Skills for Reward Modeling
摘要
开放式奖励模型要求法官在无法获得可验证的答案时能够遵循微妙的、特定领域的偏好。现有的基于规则的方法通常通过为每个查询在线生成标准来解决这个问题,但额外的生成步骤可能会增加推理开销并产生严格或不一致的指导。我们引入了 Eval-Skill,这是一种探索引导的方法,它综合了用于奖励建模的可重用评估技能,并将奖励指导重新构建为上下文演化,而不是参数训练或每个查询的标题生成。每个领域仅使用 100 个案例进行技能演化,Eval-Skill 通过两个渐进阶段综合可重用的领域级评估技能,即工作流生成和原则生成,探索和选择在两个阶段中交织。一旦生成,技能就会直接注入到判断上下文中。在多个 RM 基准测试中,Eval-Skill 持续改进多样化的判断骨干;在 RewardBench 2 上,它比每个主要主干网的普通判断都有显着的收益(Qwen3-8B + 13.44%,DeepSeek-V4-Flash 18.51%)。对演化时间尺度、普遍性和可转移性的进一步分析表明,紧凑的评估技能为基于 LLM 的评估提供了一种高效的新范式。代码可在 https://github.com/xing-stellus-yue/Eval-Skill 获取。